Tagged articles

zero-shot generalization

6 articles · Page 1 of 1
Machine Heart
Machine Heart
Sep 17, 2026 · Artificial Intelligence

World Synesthesia Model Achieves Robust Dexterous In-Hand Manipulation Under Real-World Perturbations

Sharpa Robotics' World Synesthesia Model (WSM), accepted at CoRL 2026, unifies visual geometry, tactile contact, proprioception, and action history into a reusable world model state, enabling a 22-DoF five-finger hand to achieve robust, generalizable in-hand rotation across unseen objects and real-world perturbations through clean depth supervision and recurrent memory.

CoRL 2026World Synesthesia Modeldexterous manipulation
0 likes · 12 min read
World Synesthesia Model Achieves Robust Dexterous In-Hand Manipulation Under Real-World Perturbations
DeepHub IMBA
DeepHub IMBA
Sep 4, 2026 · Artificial Intelligence

TimesFM-3: Google's Native Multivariate Forecasting with One-Pass Decoding

Google's TimesFM-3 introduces native multivariate time series forecasting with non-autoregressive decoding, enabling joint predictions across multiple targets and covariates in a single forward pass, outperforming competitors on benchmarks while offering zero-shot generalization and probabilistic outputs.

TimesFM-3Transformer architecturefoundation models
0 likes · 15 min read
TimesFM-3: Google's Native Multivariate Forecasting with One-Pass Decoding
Machine Heart
Machine Heart
Jul 18, 2026 · Artificial Intelligence

World’s First Cloud‑Deployed Embodied AI Model Swaps Robotic Hands in 30 Seconds

Visics demonstrated the world’s first cloud‑based embodied AI model at WAIC 2026, showing a single brain controlling multiple robotic hands that can be swapped in 30 seconds without retraining, achieving 99% grasp success across ten hand types using a VLOA architecture and massive video‑simulation data.

EaaSLarge Modelscloud deployment
0 likes · 10 min read
World’s First Cloud‑Deployed Embodied AI Model Swaps Robotic Hands in 30 Seconds
SuanNi
SuanNi
May 31, 2026 · Artificial Intelligence

How NVIDIA’s Gamma‑World Turns Single‑Agent Models into Multiplayer Experiences

Gamma‑World introduces a multi‑agent world model that solves identity, interaction, and real‑time inference challenges with parameter‑free geometric encoding, sparse hub attention, and teacher‑student distillation, enabling zero‑shot generalization from two to four agents and achieving 24 FPS interactive video generation.

Gamma-WorldSimplex Rotary Agent EncodingSparse Hub Attention
0 likes · 11 min read
How NVIDIA’s Gamma‑World Turns Single‑Agent Models into Multiplayer Experiences
AI Frontier Lectures
AI Frontier Lectures
Dec 15, 2025 · Artificial Intelligence

How UnityVideo Unifies Multimodal Training to Boost Video Generation

UnityVideo, a new vision framework from HKUST, CUHK, Tsinghua and Kuaishou, unifies training across depth, flow, pose, segmentation and RGB modalities, achieving faster convergence, higher video quality, zero‑shot generalization and stronger physical reasoning compared with existing single‑modality video generators.

AI researchMultimodal Video GenerationUnityVideo
0 likes · 15 min read
How UnityVideo Unifies Multimodal Training to Boost Video Generation
AI Frontier Lectures
AI Frontier Lectures
Jul 18, 2025 · Artificial Intelligence

How Anchored Attributes Boost Prompt Learning for Vision‑Language Models

The paper introduces ATPrompt, a method that inserts fixed attribute tokens into learnable prompts for CLIP‑style vision‑language models, enabling the soft prompts to capture generic attribute representations and significantly improve base‑to‑novel generalization without extra regularization losses.

ATPromptVision-Language Modelsattribute anchoring
0 likes · 20 min read
How Anchored Attributes Boost Prompt Learning for Vision‑Language Models