Tagged articles

Multimodal Fusion

20 articles · Page 1 of 1
Big Data and Microservices
Big Data and Microservices
Jul 25, 2026 · Artificial Intelligence

From Agentic AI to Autonomous Intelligence: The Next Evolution of AI Agents

The article maps the evolution of AI agents from single-task executors to multi-agent, multimodal, embodied, self‑learning, and cross‑platform systems, outlining four key directions—multimodal fusion, embodied intelligence, continuous self‑learning, and pervasive operation—backed by recent research, industry demos, and Gartner forecasts.

AI Agent EvolutionContinuous Self‑LearningCross‑Platform Agents
0 likes · 10 min read
From Agentic AI to Autonomous Intelligence: The Next Evolution of AI Agents
Machine Heart
Machine Heart
Jul 18, 2026 · Artificial Intelligence

When RGB Becomes Unreliable, InfraNet Uses Asymmetric Learning for RGB‑IR Detection

The article analyzes InfraNet, a quality‑aware RGB‑IR detection framework that separates training and inference assumptions, introduces a scalar gate (QualGate) to modulate RGB contribution, and demonstrates improved robustness and accuracy across multiple infrared object‑detection benchmarks.

InfraNetMultimodal FusionQualGate
0 likes · 9 min read
When RGB Becomes Unreliable, InfraNet Uses Asymmetric Learning for RGB‑IR Detection
Machine Heart
Machine Heart
Apr 7, 2026 · Artificial Intelligence

A Comprehensive Survey of Tactile‑Based Multimodal Fusion in Embodied Intelligence

This survey reviews state‑of‑the‑art research up to Q1 2026 on integrating tactile sensing with vision and language for embodied AI, presenting a four‑stage fusion pipeline, a hierarchical taxonomy of datasets, methods, sensors, and highlighting current evaluation challenges and future directions.

Multimodal Fusiondatasetsembodied AI
0 likes · 13 min read
A Comprehensive Survey of Tactile‑Based Multimodal Fusion in Embodied Intelligence
AI Algorithm Path
AI Algorithm Path
Feb 16, 2026 · Artificial Intelligence

Why Visual Tokenizers Bridge the Gap Between Pixels and Meaning

Vision‑language models turn continuous images into discrete tokens through patch extraction, encoding, and projection, enabling Transformers to reason jointly over vision and text, but this compression introduces limits in spatial reasoning, counting, and resolution sensitivity that users must understand.

Multimodal FusionSelf-AttentionVision-Language Models
0 likes · 22 min read
Why Visual Tokenizers Bridge the Gap Between Pixels and Meaning
Xiaomi Tech
Xiaomi Tech
Feb 5, 2026 · Artificial Intelligence

TacRefineNet: A Tactile‑Driven Model for Millimeter‑Precision Robotic Grasp Refinement

TacRefineNet leverages high‑resolution tactile sensors, multimodal fusion of fingertip touch and proprioception, and a goal‑conditioned refinement network to achieve millimeter‑level grasp adjustments without vision or 3D models, demonstrating zero‑shot deployment and robust generalization across diverse automotive‑factory parts in both simulation and real‑world tests.

Multimodal FusionSim-to-Realgrasp refinement
0 likes · 8 min read
TacRefineNet: A Tactile‑Driven Model for Millimeter‑Precision Robotic Grasp Refinement
Caiyun Tech Team
Caiyun Tech Team
Jan 30, 2026 · Artificial Intelligence

DeepFusion: A Multi-Modal Deep Fusion Network for Short-Term Heavy Rainfall Forecasting

DeepFusion combines radar, historical precipitation, numerical weather prediction, and terrain data through independent encoders and attention‑based multi‑scale fusion, achieving high‑resolution 0‑2 hour heavy‑rain forecasts and demonstrating the benefits of multi‑modal deep learning for short‑term precipitation prediction.

Attention MechanismDeepFusionMultimodal Fusion
0 likes · 13 min read
DeepFusion: A Multi-Modal Deep Fusion Network for Short-Term Heavy Rainfall Forecasting
PMTalk Product Manager Community
PMTalk Product Manager Community
Jan 7, 2026 · Artificial Intelligence

Why AI+AR Product Managers Who Fuse Sensor Data and User Behavior Are In High Demand

The article analyses AI‑augmented reality intent‑recognition systems, detailing multi‑modal data fusion, three‑way interaction architectures, and adaptive response mechanisms, and demonstrates their impact across medical surgery, elderly care, accessibility, and product design while outlining technical challenges and design methodologies.

AIARHuman-Computer Interaction
0 likes · 20 min read
Why AI+AR Product Managers Who Fuse Sensor Data and User Behavior Are In High Demand
Alibaba International Intelligent Technology
Alibaba International Intelligent Technology
Jan 5, 2026 · Artificial Intelligence

Decoupled Multimodal Fusion (DMF) Boosts User Interest Modeling for CTR Prediction

The DMF framework introduces a modality‑enriched Decoupled Target Attention (DTA) and a Complementary Modality Modeling (CMM) strategy that together close the semantic gap between ID and multimodal features, delivering up to 5.3% CTCVR lift, 7.43% GMV increase, and a three‑fold throughput gain in large‑scale e‑commerce recommendation scenarios.

A/B testingCMMCTR prediction
0 likes · 13 min read
Decoupled Multimodal Fusion (DMF) Boosts User Interest Modeling for CTR Prediction
DataFunSummit
DataFunSummit
Dec 30, 2025 · Artificial Intelligence

How Large Models Are Revolutionizing Anti‑Fraud Detection: Fusion, Script Recognition, and Automated Iteration

This article examines how a major internet platform leverages large‑model AI—through multimodal fusion, script‑recognition fine‑tuning, and an automatic model‑iteration framework—to overcome precision, adversarial, and cross‑scenario challenges in fraud detection, and how agent‑based tools further boost operational efficiency.

Model IterationMultimodal Fusionagent automation
0 likes · 24 min read
How Large Models Are Revolutionizing Anti‑Fraud Detection: Fusion, Script Recognition, and Automated Iteration
Smart Era Software Development
Smart Era Software Development
Dec 11, 2025 · Artificial Intelligence

From Scale Race to Efficiency Breakthrough: How Architecture Innovation Will Shape 2026 Large Models and Agents

The article analyzes how architecture innovation—through sparse, multimodal, and dynamic designs—will break the compute bottleneck of large models, reshape pre‑training hierarchies, and drive three distinct 2026 pathways for both model efficiency and agent competition.

2026 predictionsAI agentsLarge Language Models
0 likes · 12 min read
From Scale Race to Efficiency Breakthrough: How Architecture Innovation Will Shape 2026 Large Models and Agents
Data Party THU
Data Party THU
Oct 28, 2025 · Artificial Intelligence

How AI is Reviving Dunhuang Murals: From 3D Scans to Digital Restoration

This article examines the cutting‑edge AI techniques—multimodal fusion, deep‑learning disease detection, reversible repair, diffusion‑Transformer models, GAN‑based pattern generation, and AR navigation—that enable millimetre‑level digital restoration and cultural democratization of the Dunhuang murals.

AIARCultural Heritage
0 likes · 14 min read
How AI is Reviving Dunhuang Murals: From 3D Scans to Digital Restoration
Bighead's Algorithm Notes
Bighead's Algorithm Notes
Oct 25, 2025 · Artificial Intelligence

Time Series Paper Digest: Extreme Event Prediction, Multimodal Fusion & Anomaly Detection

This article summarizes four recent arXiv papers on time‑series forecasting, covering a hierarchical knowledge‑distillation framework for extreme events, a graph‑enhanced multimodal fusion network, an interpretable unsupervised anomaly detector, and an adaptive masking loss that improves prediction accuracy.

Multimodal Fusionadaptive maskinganomaly detection
0 likes · 10 min read
Time Series Paper Digest: Extreme Event Prediction, Multimodal Fusion & Anomaly Detection
AIWalker
AIWalker
Jun 24, 2025 · Artificial Intelligence

How Multimodal Fusion Accelerates Paper Publication: Key Insights and Resources

The article surveys 117 recent multimodal‑fusion papers, classifies them into improvement‑based and combination‑based approaches, highlights representative works such as TimeXL, OGP‑Net, MMR‑Mamba and FusionSight, and provides a free collection of papers, classic models and code repositories for researchers.

AI researchMultimodal Fusioncomputer vision
0 likes · 8 min read
How Multimodal Fusion Accelerates Paper Publication: Key Insights and Resources
DataFunSummit
DataFunSummit
Jan 15, 2025 · Artificial Intelligence

Decentralized Distribution in Xiaohongshu: Strengthening Sideinfo, Multimodal Fusion, and Interest Exploration

This article details Xiaohongshu's technical approaches to solving decentralized content distribution by enhancing side‑information usage, integrating multimodal signals across the recommendation pipeline, applying graph‑based models, and implementing interest exploration and protection mechanisms, while also outlining future research directions.

Multimodal Fusiondecentralized-distributiongraph models
0 likes · 24 min read
Decentralized Distribution in Xiaohongshu: Strengthening Sideinfo, Multimodal Fusion, and Interest Exploration
AntTech
AntTech
Sep 28, 2023 · Artificial Intelligence

IEEE Publishes Three International Standards for Biometric Recognition Performance Evaluation

IEEE has officially released three new international standards—IEEE 2884-2023 for face recognition, IEEE 2891-2023 for fingerprint recognition, and IEEE 2859-2023 for multimodal fusion—developed by Ant Group and partners to provide unified, secure and cost‑effective testing frameworks for biometric systems worldwide.

Biometric StandardsIEEEMultimodal Fusion
0 likes · 5 min read
IEEE Publishes Three International Standards for Biometric Recognition Performance Evaluation
Youku Technology
Youku Technology
Oct 28, 2022 · Artificial Intelligence

Enlarging Long‑time Dependencies via Reinforcement‑Learning‑Based Memory Network for Movie Affective Analysis

The authors introduce a reinforcement‑learning‑driven memory network that augments long‑range dependencies for continuous valence‑arousal emotion prediction in movies, integrating five multimodal features and a DDPG‑based update policy, which yields state‑of‑the‑art performance across multiple affective‑analysis and summarization benchmarks.

Multimodal FusionVA affect modellong‑term dependencies
0 likes · 16 min read
Enlarging Long‑time Dependencies via Reinforcement‑Learning‑Based Memory Network for Movie Affective Analysis