Tagged articles

multimodal fusion

22 articles · Page 1 of 1
Machine Heart
Machine Heart
Sep 17, 2026 · Artificial Intelligence

World Synesthesia Model Achieves Robust Dexterous In-Hand Manipulation Under Real-World Perturbations

Sharpa Robotics' World Synesthesia Model (WSM), accepted at CoRL 2026, unifies visual geometry, tactile contact, proprioception, and action history into a reusable world model state, enabling a 22-DoF five-finger hand to achieve robust, generalizable in-hand rotation across unseen objects and real-world perturbations through clean depth supervision and recurrent memory.

CoRL 2026World ModelsWorld Synesthesia Model
0 likes · 12 min read
World Synesthesia Model Achieves Robust Dexterous In-Hand Manipulation Under Real-World Perturbations
AntTech
AntTech
Sep 2, 2026 · Artificial Intelligence

ECCV 2026 Paper Showcase: Breaking Vision Perception & Prediction Boundaries

This article summarizes four ECCV 2026 papers: a dynamic cross-layer injection framework for deep vision-language fusion, an event-augmented VLA model enabling robot operation in extreme darkness and blur, a predictive differentiable rendering method using 2D Gaussians for high-fidelity video prediction, and a data-scaling approach for high-resolution weather forecasting that demonstrates clear scaling laws.

Data ScalingECCV 2026Embodied AI
0 likes · 10 min read
ECCV 2026 Paper Showcase: Breaking Vision Perception & Prediction Boundaries
Big Data and Microservices
Big Data and Microservices
Jul 25, 2026 · Artificial Intelligence

From Agentic AI to Autonomous Intelligence: The Next Evolution of AI Agents

The article maps the evolution of AI agents from single-task executors to multi-agent, multimodal, embodied, self‑learning, and cross‑platform systems, outlining four key directions—multimodal fusion, embodied intelligence, continuous self‑learning, and pervasive operation—backed by recent research, industry demos, and Gartner forecasts.

AI Agent EvolutionAgentic AIContinuous Self‑Learning
0 likes · 10 min read
From Agentic AI to Autonomous Intelligence: The Next Evolution of AI Agents
Machine Heart
Machine Heart
Jul 18, 2026 · Artificial Intelligence

When RGB Becomes Unreliable, InfraNet Uses Asymmetric Learning for RGB‑IR Detection

The article analyzes InfraNet, a quality‑aware RGB‑IR detection framework that separates training and inference assumptions, introduces a scalar gate (QualGate) to modulate RGB contribution, and demonstrates improved robustness and accuracy across multiple infrared object‑detection benchmarks.

InfraNetQualGateRGB-IR detection
0 likes · 9 min read
When RGB Becomes Unreliable, InfraNet Uses Asymmetric Learning for RGB‑IR Detection
Machine Heart
Machine Heart
Apr 7, 2026 · Artificial Intelligence

A Comprehensive Survey of Tactile‑Based Multimodal Fusion in Embodied Intelligence

This survey reviews state‑of‑the‑art research up to Q1 2026 on integrating tactile sensing with vision and language for embodied AI, presenting a four‑stage fusion pipeline, a hierarchical taxonomy of datasets, methods, sensors, and highlighting current evaluation challenges and future directions.

Embodied AIdatasetsevaluation benchmarks
0 likes · 13 min read
A Comprehensive Survey of Tactile‑Based Multimodal Fusion in Embodied Intelligence
AI Algorithm Path
AI Algorithm Path
Feb 16, 2026 · Artificial Intelligence

Why Visual Tokenizers Bridge the Gap Between Pixels and Meaning

Vision‑language models turn continuous images into discrete tokens through patch extraction, encoding, and projection, enabling Transformers to reason jointly over vision and text, but this compression introduces limits in spatial reasoning, counting, and resolution sensitivity that users must understand.

Vision-Language Modelscountingmultimodal fusion
0 likes · 22 min read
Why Visual Tokenizers Bridge the Gap Between Pixels and Meaning
Xiaomi Tech
Xiaomi Tech
Feb 5, 2026 · Artificial Intelligence

TacRefineNet: A Tactile‑Driven Model for Millimeter‑Precision Robotic Grasp Refinement

TacRefineNet leverages high‑resolution tactile sensors, multimodal fusion of fingertip touch and proprioception, and a goal‑conditioned refinement network to achieve millimeter‑level grasp adjustments without vision or 3D models, demonstrating zero‑shot deployment and robust generalization across diverse automotive‑factory parts in both simulation and real‑world tests.

Zero-shot Learninggrasp refinementmultimodal fusion
0 likes · 8 min read
TacRefineNet: A Tactile‑Driven Model for Millimeter‑Precision Robotic Grasp Refinement
Caiyun Tech Team
Caiyun Tech Team
Jan 30, 2026 · Artificial Intelligence

DeepFusion: A Multi-Modal Deep Fusion Network for Short-Term Heavy Rainfall Forecasting

DeepFusion combines radar, historical precipitation, numerical weather prediction, and terrain data through independent encoders and attention‑based multi‑scale fusion, achieving high‑resolution 0‑2 hour heavy‑rain forecasts and demonstrating the benefits of multi‑modal deep learning for short‑term precipitation prediction.

Attention MechanismDeepFusionNWP
0 likes · 13 min read
DeepFusion: A Multi-Modal Deep Fusion Network for Short-Term Heavy Rainfall Forecasting
PMTalk Product Manager Community
PMTalk Product Manager Community
Jan 7, 2026 · Artificial Intelligence

Why AI+AR Product Managers Who Fuse Sensor Data and User Behavior Are In High Demand

The article analyses AI‑augmented reality intent‑recognition systems, detailing multi‑modal data fusion, three‑way interaction architectures, and adaptive response mechanisms, and demonstrates their impact across medical surgery, elderly care, accessibility, and product design while outlining technical challenges and design methodologies.

AIARHuman-Computer Interaction
0 likes · 20 min read
Why AI+AR Product Managers Who Fuse Sensor Data and User Behavior Are In High Demand
Alibaba International Intelligent Technology
Alibaba International Intelligent Technology
Jan 5, 2026 · Artificial Intelligence

Decoupled Multimodal Fusion (DMF) Boosts User Interest Modeling for CTR Prediction

The DMF framework introduces a modality‑enriched Decoupled Target Attention (DTA) and a Complementary Modality Modeling (CMM) strategy that together close the semantic gap between ID and multimodal features, delivering up to 5.3% CTCVR lift, 7.43% GMV increase, and a three‑fold throughput gain in large‑scale e‑commerce recommendation scenarios.

A/B testingCMMCTR prediction
0 likes · 13 min read
Decoupled Multimodal Fusion (DMF) Boosts User Interest Modeling for CTR Prediction
DataFunSummit
DataFunSummit
Dec 30, 2025 · Artificial Intelligence

How Large Models Are Revolutionizing Anti‑Fraud Detection: Fusion, Script Recognition, and Automated Iteration

This article examines how a major internet platform leverages large‑model AI—through multimodal fusion, script‑recognition fine‑tuning, and an automatic model‑iteration framework—to overcome precision, adversarial, and cross‑scenario challenges in fraud detection, and how agent‑based tools further boost operational efficiency.

Agent AutomationModel Iterationanti-fraud
0 likes · 24 min read
How Large Models Are Revolutionizing Anti‑Fraud Detection: Fusion, Script Recognition, and Automated Iteration
Smart Era Software Development
Smart Era Software Development
Dec 11, 2025 · Artificial Intelligence

From Scale Race to Efficiency Breakthrough: How Architecture Innovation Will Shape 2026 Large Models and Agents

The article analyzes how architecture innovation—through sparse, multimodal, and dynamic designs—will break the compute bottleneck of large models, reshape pre‑training hierarchies, and drive three distinct 2026 pathways for both model efficiency and agent competition.

2026 predictionsAI agentsarchitecture innovation
0 likes · 12 min read
From Scale Race to Efficiency Breakthrough: How Architecture Innovation Will Shape 2026 Large Models and Agents
Data Party THU
Data Party THU
Oct 28, 2025 · Artificial Intelligence

How AI is Reviving Dunhuang Murals: From 3D Scans to Digital Restoration

This article examines the cutting‑edge AI techniques—multimodal fusion, deep‑learning disease detection, reversible repair, diffusion‑Transformer models, GAN‑based pattern generation, and AR navigation—that enable millimetre‑level digital restoration and cultural democratization of the Dunhuang murals.

AIARCultural Heritage
0 likes · 14 min read
How AI is Reviving Dunhuang Murals: From 3D Scans to Digital Restoration
Bighead's Algorithm Notes
Bighead's Algorithm Notes
Oct 25, 2025 · Artificial Intelligence

Time Series Paper Digest: Extreme Event Prediction, Multimodal Fusion & Anomaly Detection

This article summarizes four recent arXiv papers on time‑series forecasting, covering a hierarchical knowledge‑distillation framework for extreme events, a graph‑enhanced multimodal fusion network, an interpretable unsupervised anomaly detector, and an adaptive masking loss that improves prediction accuracy.

Time Seriesadaptive maskinganomaly detection
0 likes · 10 min read
Time Series Paper Digest: Extreme Event Prediction, Multimodal Fusion & Anomaly Detection
AIWalker
AIWalker
Jun 24, 2025 · Artificial Intelligence

How Multimodal Fusion Accelerates Paper Publication: Key Insights and Resources

The article surveys 117 recent multimodal‑fusion papers, classifies them into improvement‑based and combination‑based approaches, highlights representative works such as TimeXL, OGP‑Net, MMR‑Mamba and FusionSight, and provides a free collection of papers, classic models and code repositories for researchers.

AI researchPaper Surveycomputer vision
0 likes · 8 min read
How Multimodal Fusion Accelerates Paper Publication: Key Insights and Resources
DataFunSummit
DataFunSummit
Jan 15, 2025 · Artificial Intelligence

Decentralized Distribution in Xiaohongshu: Strengthening Sideinfo, Multimodal Fusion, and Interest Exploration

This article details Xiaohongshu's technical approaches to solving decentralized content distribution by enhancing side‑information usage, integrating multimodal signals across the recommendation pipeline, applying graph‑based models, and implementing interest exploration and protection mechanisms, while also outlining future research directions.

decentralized-distributiongraph modelsinterest-exploration
0 likes · 24 min read
Decentralized Distribution in Xiaohongshu: Strengthening Sideinfo, Multimodal Fusion, and Interest Exploration
AntTech
AntTech
Sep 28, 2023 · Artificial Intelligence

IEEE Publishes Three International Standards for Biometric Recognition Performance Evaluation

IEEE has officially released three new international standards—IEEE 2884-2023 for face recognition, IEEE 2891-2023 for fingerprint recognition, and IEEE 2859-2023 for multimodal fusion—developed by Ant Group and partners to provide unified, secure and cost‑effective testing frameworks for biometric systems worldwide.

Biometric StandardsIEEEmultimodal fusion
0 likes · 5 min read
IEEE Publishes Three International Standards for Biometric Recognition Performance Evaluation
Youku Technology
Youku Technology
Oct 28, 2022 · Artificial Intelligence

Enlarging Long‑time Dependencies via Reinforcement‑Learning‑Based Memory Network for Movie Affective Analysis

The authors introduce a reinforcement‑learning‑driven memory network that augments long‑range dependencies for continuous valence‑arousal emotion prediction in movies, integrating five multimodal features and a DDPG‑based update policy, which yields state‑of‑the‑art performance across multiple affective‑analysis and summarization benchmarks.

VA affect modellong‑term dependenciesmemory network
0 likes · 16 min read
Enlarging Long‑time Dependencies via Reinforcement‑Learning‑Based Memory Network for Movie Affective Analysis