Tổng quan Lời nói đầu
Sách này giải quyết vấn đề gì?
Preface
TL;DR
- LLM vào production nhanh hơn khả năng kiểm chứng nó có chạy đúng không.
- Sách đưa ra một quy trình thực dụng: Analyze → Measure → Improve.
- Chỉ bàn về eval cho ứng dụng cụ thể của bạn, không bàn benchmark model nền tảng.
0.1Vì sao output LLM khó đánh giá
🎭
Đúng mà không hợp
Đúng sự thật nhưng không phù hợp ngữ cảnh.
🎤
Thuyết phục mà sai
Văn phong tự tin, nội dung lại sai.
🧩
Trả lời gần hết
Giải quyết phần lớn câu hỏi nhưng bỏ sót một phần.
Ba câu hỏi cốt lõi của cả cuốn sách: (1) pipeline có đủ tốt không? (2) nó hỏng ở đâu? (3) cải thiện có hệ thống như thế nào?
0.2Bản đồ 4 phần
0.3Bền vững vs. thay đổi nhanh
- Định nghĩa "output tốt" cho use case của bạn.
- Chia chất lượng thành các chiều cụ thể, quan sát được.
- Xây dataset giống cách dùng thật.
- Phân tích lỗi trước khi thay đổi hệ thống.
- Đo mọi thay đổi so với baseline.
- Kết hợp check tự động với phán đoán của con người.
- Khép vòng: dùng kết quả eval để cải thiện.
- Dùng AI để tìm và nhóm lỗi
- Chọn trace nào cho người gán nhãn
- Viết và kiểm định LLM judge cho một task cụ thể
- Để agent đề xuất test case
- Quyết định chỗ nào con người review/override
0.4Phạm vi
| ✅ Có | ❌ Không |
|---|---|
| Eval theo ứng dụng: pipeline của bạn có chạy tốt cho use case của bạn không | Benchmark model nền tảng (MMLU, HellaSwag…) |
| Phân tích lỗi, LLM-as-judge, CI/CD, monitoring, cải thiện | Huấn luyện / fine-tune model từ đầu |
| Chọn model bằng cách prototype trên dữ liệu thật rồi eval | Chọn model chỉ dựa trên điểm benchmark |
Áp dụng cho dự án model-routing của bạn
Điểm cuối cùng ở trên nói thẳng vào bài toán routing: đừng route chỉ dựa trên leaderboard. Hãy chạy các model ứng viên trên traffic thật của bạn, rồi dùng quy trình Analyze → Measure của sách để quyết định model nào đủ tốt cho loại request nào.Tài nguyên: code & bài tập — github.com/oreillymedia/ai-evals-book · khoá học — evals.info/book