Bản đồ Toàn cuốn sách

Evals for AI Engineers — Sổ tay tóm tắt & minh hoạ

Shreya Shankar & Hamel Husain · O'Reilly (Early Release)

Cách dùng sổ tay này

  • Mỗi chương gồm: TL;DR → khái niệm kèm sơ đồ → bảng so sánh → lỗi thường gặp → tự kiểm traáp dụng cho dự án model-routing.
  • Nên đọc chương 1 → 3 trước. Sau đó đọc chương nào tuỳ nhu cầu.
  • Bản markdown của từng chương nằm trong eval-ai/summaries/.

Bức tranh toàn cảnh

NỀN TẢNG Ch1 Ba Vực thẳm: Comprehension · Specification · Generalization · Ch2 Thành phần agent, prompt, setup eval ANALYZE Hỏng ở đâu? Ch3 Phân tích lỗi open → axial coding Ch4 Đánh giá cộng tác rubric, Cohen's kappa MEASURE Hỏng bao nhiêu? Ch5 Evaluator tự động LLM-as-judge, TPR/TNR Ch6 Hội thoại nhiều lượt Ch7 RAG Ch8 Tool use & agent IMPROVE Sửa & giữ vững Ch9 CI/CD & monitoring Ch10 UI review thủ công Ch11 Phân tích trace Ch12 Cải thiện agent accuracy, cost, cascade, routing kết quả cải thiện + trace production mới → quay lại Analyze
Các chương được xếp theo vòng lặp Analyze → Measure → Improve.

Các chương

0 · Lời nói đầu

Sách giải quyết vấn đề gì, 7 nguyên tắc bền vững, phạm vi.

1 · Giới thiệu & Ba Vực thẳm

Eval là gì; Comprehension / Specification / Generalization; vòng lặp Analyze–Measure–Improve.

2 · LLM & cơ bản về đánh giá

Thành phần agent (1 lần gọi, hội thoại, retrieval, tool, vòng lặp agent), prompt, eval tuyệt đối vs. so sánh.

3 · Phân tích lỗi

Dataset trace ban đầu, dimensions & tuples, open coding → axial coding, gán nhãn failure modes.

4 · Đánh giá cộng tác

Quy trình gán nhãn nhiều người, Cohen's kappa, buổi alignment, cải thiện rubric.

5 · Evaluator tự động

Chọn metric, LLM-as-judge, chia data, TPR/TNR, hiệu chỉnh tỉ lệ thành công, bootstrap CI.

6 · Hội thoại nhiều lượt

Eval cấp session vs. turn, memory, user simulator, perturbation testing.

7 · Đánh giá RAG

Sinh cặp Q&A tổng hợp, Precision/Recall@k, MRR, NDCG, chunking, chất lượng generation.

8 · Tool use & agent phức tạp

4 giai đoạn tool call, debug trace nhiều bước, heatmap lỗi chuyển trạng thái, bảo mật.

9 · CI/CD cho LLM agent

CI chống regression, monitoring online, guardrails, judge drift, flywheel cải thiện.

10 · Giao diện review thủ công

UI review tuỳ biến, chiến lược chọn trace, clustering, tích hợp vào quy trình kỹ thuật.

11 · Phân tích dữ liệu trace

EDA & clustering tạo giả thuyết, semantic search, dùng AI coding assistant.

12 · Cải thiện LLM agent

Tối ưu độ chính xác theo mức công sức, tối ưu chi phí, model cascade, routing.

Aa · Thuật ngữ Anh–Việt

Tra nhanh các khái niệm eval dùng xuyên suốt sách.

Lộ trình đọc gợi ý cho dự án model-routing

  1. Ch1 → Ch3: khung tư duy + phân tích lỗi trên trace routing thật.
  2. Ch5: xây judge chấm "model được chọn có đủ tốt không", hiệu chỉnh tỉ lệ thành công và CI.
  3. Ch12 (cascade, confidence, routing) — nội dung trực tiếp nhất cho bài toán của bạn.
  4. Ch9: đưa bộ eval routing vào CI và monitoring production.