Tagged articles

HealthBench

2 articles · Page 1 of 1
Machine Learning Algorithms & Natural Language Processing
Machine Learning Algorithms & Natural Language Processing
Aug 10, 2026 · Artificial Intelligence

Can Models Keep Getting Stronger After Deployment? SERPO Enables Label‑Free Self‑Evolution on Open‑Ended Tasks

The SERPO framework replaces answer‑voting with a self‑evolving rubric, allowing test‑time reinforcement learning to improve large language models on open‑ended tasks without any human labels, and demonstrates up to 73% of privileged‑supervision gains on benchmarks such as HealthBench and ResearchQA.

AI EvaluationHealthBenchOpen-Ended Tasks
0 likes · 15 min read
Can Models Keep Getting Stronger After Deployment? SERPO Enables Label‑Free Self‑Evolution on Open‑Ended Tasks
SuanNi
SuanNi
May 12, 2026 · Artificial Intelligence

AntAngelMed: 6.1B‑Activated MoE Model Tops Three Medical Benchmarks

AntAngelMed, a 100‑billion‑parameter medical LLM using a 6.1 billion‑parameter MoE architecture, achieves performance comparable to a 40 billion‑parameter dense model, exceeds 200 tokens/s inference speed, and ranks first on HealthBench, MedAIBench and MedBench, with a three‑stage training pipeline and extensive efficiency optimizations.

HealthBenchLarge Language ModelMedAIBench
0 likes · 6 min read
AntAngelMed: 6.1B‑Activated MoE Model Tops Three Medical Benchmarks