Strong Model ≠ Strong Agent: PolyWorkBench Benchmarks Cross-Lingual Long-Horizon Workflows
PolyWorkBench introduces 67 cross-lingual long-horizon workflow tasks across 5 domains and 10 languages, revealing that top models like Claude Opus 4.8 show 22.5% performance variance across agent harnesses and significant drops on commerce tasks and low-resource languages due to language understanding and cross-lingual coordination errors.
