Tagged articles

Cross-Lingual Evaluation

1 articles · Page 1 of 1
Machine Learning Algorithms & Natural Language Processing
Machine Learning Algorithms & Natural Language Processing
Sep 8, 2026 · Artificial Intelligence

Strong Model ≠ Strong Agent: PolyWorkBench Benchmarks Cross-Lingual Long-Horizon Workflows

PolyWorkBench introduces 67 cross-lingual long-horizon workflow tasks across 5 domains and 10 languages, revealing that top models like Claude Opus 4.8 show 22.5% performance variance across agent harnesses and significant drops on commerce tasks and low-resource languages due to language understanding and cross-lingual coordination errors.

Agent BenchmarksClaude OpusCross-Lingual Evaluation
0 likes · 10 min read
Strong Model ≠ Strong Agent: PolyWorkBench Benchmarks Cross-Lingual Long-Horizon Workflows