Tổng quan Lời nói đầu

Sách này giải quyết vấn đề gì?

Preface

TL;DR

  • LLM vào production nhanh hơn khả năng kiểm chứng nó có chạy đúng không.
  • Sách đưa ra một quy trình thực dụng: Analyze → Measure → Improve.
  • Chỉ bàn về eval cho ứng dụng cụ thể của bạn, không bàn benchmark model nền tảng.

0.1Vì sao output LLM khó đánh giá

🎭
Đúng mà không hợp

Đúng sự thật nhưng không phù hợp ngữ cảnh.

🎤
Thuyết phục mà sai

Văn phong tự tin, nội dung lại sai.

🧩
Trả lời gần hết

Giải quyết phần lớn câu hỏi nhưng bỏ sót một phần.

Ba câu hỏi cốt lõi của cả cuốn sách: (1) pipeline có đủ tốt không? (2) nó hỏng ở đâu? (3) cải thiện có hệ thống như thế nào?

0.2Bản đồ 4 phần

I · Nền tảng Ch 1–2 Ba Vực thẳm Agent, prompt, setup eval II · Analyze Ch 3–4 Phân tích lỗi Gán nhãn cộng tác Đồng thuận (kappa) III · Measure Ch 5–8 LLM-as-judge Multi-turn · RAG Tool & agent IV · Production Ch 9–12 CI/CD, monitoring Review UI, trace data Cải thiện, cascade
Khuyến nghị của tác giả: đọc chương 1–3 trước, đó là nền móng cho phần còn lại.

0.3Bền vững vs. thay đổi nhanh

  1. Định nghĩa "output tốt" cho use case của bạn.
  2. Chia chất lượng thành các chiều cụ thể, quan sát được.
  3. Xây dataset giống cách dùng thật.
  4. Phân tích lỗi trước khi thay đổi hệ thống.
  5. Đo mọi thay đổi so với baseline.
  6. Kết hợp check tự động với phán đoán của con người.
  7. Khép vòng: dùng kết quả eval để cải thiện.
  • Dùng AI để tìm và nhóm lỗi
  • Chọn trace nào cho người gán nhãn
  • Viết và kiểm định LLM judge cho một task cụ thể
  • Để agent đề xuất test case
  • Quyết định chỗ nào con người review/override

0.4Phạm vi

✅ Có❌ Không
Eval theo ứng dụng: pipeline của bạn có chạy tốt cho use case của bạn khôngBenchmark model nền tảng (MMLU, HellaSwag…)
Phân tích lỗi, LLM-as-judge, CI/CD, monitoring, cải thiệnHuấn luyện / fine-tune model từ đầu
Chọn model bằng cách prototype trên dữ liệu thật rồi evalChọn model chỉ dựa trên điểm benchmark

Áp dụng cho dự án model-routing của bạn

Điểm cuối cùng ở trên nói thẳng vào bài toán routing: đừng route chỉ dựa trên leaderboard. Hãy chạy các model ứng viên trên traffic thật của bạn, rồi dùng quy trình Analyze → Measure của sách để quyết định model nào đủ tốt cho loại request nào.

Tài nguyên: code & bài tập — github.com/oreillymedia/ai-evals-book · khoá học — evals.info/book