Machine Learning Algorithms & Natural Language Processing
Sep 12, 2026 · Artificial Intelligence
SafeEvolve: Co-Evolving Harness and Policy for Self-Improving Agent Safety
SafeEvolve introduces a co-evolution framework where Agent Harness and Policy jointly learn from execution trajectories, reducing attack success rates to 0.79% on AgentDojo and 2.42% on Qwen3-4B while improving task utility, enabling continuous safety improvement from real-world experience.
AI SafetyAgent SafetyHarness-Policy Co-Evolution
0 likes · 9 min read
