Evals for AI Engineers — Sổ tay tóm tắt & minh hoạ
Cách dùng sổ tay này
- Mỗi chương gồm: TL;DR → khái niệm kèm sơ đồ → bảng so sánh → lỗi thường gặp → tự kiểm tra → áp dụng cho dự án model-routing.
- Nên đọc chương 1 → 3 trước. Sau đó đọc chương nào tuỳ nhu cầu.
- Bản markdown của từng chương nằm trong
eval-ai/summaries/.
Bức tranh toàn cảnh
Các chương
Sách giải quyết vấn đề gì, 7 nguyên tắc bền vững, phạm vi.
Eval là gì; Comprehension / Specification / Generalization; vòng lặp Analyze–Measure–Improve.
Thành phần agent (1 lần gọi, hội thoại, retrieval, tool, vòng lặp agent), prompt, eval tuyệt đối vs. so sánh.
Dataset trace ban đầu, dimensions & tuples, open coding → axial coding, gán nhãn failure modes.
Quy trình gán nhãn nhiều người, Cohen's kappa, buổi alignment, cải thiện rubric.
Chọn metric, LLM-as-judge, chia data, TPR/TNR, hiệu chỉnh tỉ lệ thành công, bootstrap CI.
Eval cấp session vs. turn, memory, user simulator, perturbation testing.
Sinh cặp Q&A tổng hợp, Precision/Recall@k, MRR, NDCG, chunking, chất lượng generation.
4 giai đoạn tool call, debug trace nhiều bước, heatmap lỗi chuyển trạng thái, bảo mật.
CI chống regression, monitoring online, guardrails, judge drift, flywheel cải thiện.
UI review tuỳ biến, chiến lược chọn trace, clustering, tích hợp vào quy trình kỹ thuật.
EDA & clustering tạo giả thuyết, semantic search, dùng AI coding assistant.
Tối ưu độ chính xác theo mức công sức, tối ưu chi phí, model cascade, routing.
Tra nhanh các khái niệm eval dùng xuyên suốt sách.
Lộ trình đọc gợi ý cho dự án model-routing
- Ch1 → Ch3: khung tư duy + phân tích lỗi trên trace routing thật.
- Ch5: xây judge chấm "model được chọn có đủ tốt không", hiệu chỉnh tỉ lệ thành công và CI.
- Ch12 (cascade, confidence, routing) — nội dung trực tiếp nhất cho bài toán của bạn.
- Ch9: đưa bộ eval routing vào CI và monitoring production.