Machine Learning Algorithms & Natural Language Processing
Sep 8, 2026 · Artificial Intelligence
Strong Model ≠ Strong Agent: PolyWorkBench Benchmarks Cross-Lingual Long-Horizon Workflows
PolyWorkBench introduces 67 cross-lingual long-horizon workflow tasks across 5 domains and 10 languages, revealing that top models like Claude Opus 4.8 show 22.5% performance variance across agent harnesses and significant drops on commerce tasks and low-resource languages due to language understanding and cross-lingual coordination errors.
Agent BenchmarksClaude OpusCross-Lingual Evaluation
0 likes · 10 min read
