Tagged articles

Multimodal Video Generation

4 articles · Page 1 of 1
Machine Heart
Machine Heart
Jul 31, 2026 · Artificial Intelligence

MiniMax H3 Review: Full‑Modal Video Editing Beats After Effects for Just 0.5 CNY per Second

MiniMax H3, an open‑source multimodal video model, achieves SOTA performance, supports text, image and video inputs with native stereo audio, costs as low as 0.5 CNY per second, and demonstrates seamless editing capabilities that rival traditional After Effects workflows.

AI Video EditingAI‑Native Post‑ProductionComputer Vision
0 likes · 12 min read
MiniMax H3 Review: Full‑Modal Video Editing Beats After Effects for Just 0.5 CNY per Second
Machine Heart
Machine Heart
May 11, 2026 · Artificial Intelligence

UniVidX Sets New SOTA on Multiple Video Tasks – A Unified Multimodal Framework Presented at SIGGRAPH 2026

UniVidX, a unified multimodal framework for video generation and understanding accepted at SIGGRAPH 2026, reformulates diverse video graphics tasks as conditional generation, achieving or surpassing state‑of‑the‑art performance while demonstrating strong data efficiency and cross‑domain generalization.

Data EfficiencyMultimodal Video GenerationSIGGRAPH 2026
0 likes · 10 min read
UniVidX Sets New SOTA on Multiple Video Tasks – A Unified Multimodal Framework Presented at SIGGRAPH 2026
AI Frontier Lectures
AI Frontier Lectures
Dec 15, 2025 · Artificial Intelligence

How UnityVideo Unifies Multimodal Training to Boost Video Generation

UnityVideo, a new vision framework from HKUST, CUHK, Tsinghua and Kuaishou, unifies training across depth, flow, pose, segmentation and RGB modalities, achieving faster convergence, higher video quality, zero‑shot generalization and stronger physical reasoning compared with existing single‑modality video generators.

AI researchMultimodal Video GenerationUnityVideo
0 likes · 15 min read
How UnityVideo Unifies Multimodal Training to Boost Video Generation
HyperAI Super Neural
HyperAI Super Neural
Oct 23, 2025 · Artificial Intelligence

Hands‑On Tutorial: HuMo‑1.7B Multimodal Video Generation Framework for Unified Text‑Image‑Audio Creation

The article introduces HuMo‑1.7B, a multimodal video generation framework that jointly processes text, reference images, and audio, achieves SOTA performance on several sub‑tasks, and provides a step‑by‑step tutorial for running the model on the HyperAI platform with detailed resource and parameter guidance.

AI diffusion modelHuMoHyperAI
0 likes · 6 min read
Hands‑On Tutorial: HuMo‑1.7B Multimodal Video Generation Framework for Unified Text‑Image‑Audio Creation