Tagged articles

RAG evaluation

5 articles · Page 1 of 1
Software Engineering 3.0 Era
Software Engineering 3.0 Era
Sep 7, 2026 · Artificial Intelligence

AI Agent Evaluation Guide: Building Observable, Evaluable, Self-Evolving Quality Systems

This comprehensive guide synthesizes 2026 industry practices from Xiaohongshu and Alipay to build production-ready AI Agent evaluation systems, covering metrics (Quality/Cost/Safety), three-tier evaluation granularities, Judge system design, OpenTelemetry-based observability, platform architecture with contract-driven test generation, dual flywheel offline/online loops, and self-evolving prompt optimization — moving evaluation from post-hoc verification to embedded engineering guardrails.

AI Agent EvaluationAgentOpsEvaluation Methodology
0 likes · 37 min read
AI Agent Evaluation Guide: Building Observable, Evaluable, Self-Evolving Quality Systems
Data Bricklaying Diary
Data Bricklaying Diary
Jul 22, 2026 · Artificial Intelligence

Beyond Accuracy: A Five-Layer Framework for Evaluating High-Quality AI Datasets

This article presents a five-layer evaluation framework for high-quality AI datasets—covering basic data quality, business semantics, task adaptation, AI application effects, and trustworthy operations—emphasizing task-specific validation over generic metrics and advocating admission vs. optimization metrics with automated, expert, and task-based verification.

AI data qualityRAG evaluationadmission metrics
0 likes · 13 min read
Beyond Accuracy: A Five-Layer Framework for Evaluating High-Quality AI Datasets
James' Growth Diary
James' Growth Diary
May 24, 2026 · Artificial Intelligence

End-to-End Observability with LangSmith: Trace Debugging and RAG Evaluation from Development to Production

This article walks through LangSmith’s three core capabilities—Trace, Evaluation, and Dataset management—showing how to integrate zero‑code tracing, quantify RAG performance with custom evaluators, run version‑comparison experiments, and set up production monitoring with sampling and feedback loops.

LangChainLangSmithObservability
0 likes · 23 min read
End-to-End Observability with LangSmith: Trace Debugging and RAG Evaluation from Development to Production
dbaplus Community
dbaplus Community
Jun 18, 2024 · Artificial Intelligence

How to Effectively Evaluate RAG Systems: Metrics, Tools, and Best Practices

Evaluating Retrieval‑Augmented Generation (RAG) systems requires both component‑level and end‑to‑end metrics—such as context relevance, recall, answer relevance, and groundedness—and can be automated with tools like TruLens, RAGAS, LangSmith, and Langfuse, enabling systematic selection and optimization of LLM applications.

AI metricsLLMLangSmith
0 likes · 8 min read
How to Effectively Evaluate RAG Systems: Metrics, Tools, and Best Practices