Tham khảo Thuật ngữ
Bảng thuật ngữ Anh–Việt
Glossary of evaluation terms
| Thuật ngữ | Tiếng Việt / giải thích | Chương |
|---|---|---|
| Agent | Phần do LLM điều khiển: suy luận, gọi tool, sinh output. Từ 1 lần gọi LLM đến vòng lặp nhiều bước. | 1, 2 |
| Application | Mọi thứ bao quanh agent: UI, DB, API, hạ tầng. | 1 |
| Trace | Bản ghi đầy đủ những gì agent làm cho một request (input, các bước, tool call, output). | 1, 3 |
| Failure mode | Kiểu hỏng / dạng lỗi lặp lại được đặt tên rõ ràng. | 3 |
| Gulf of Comprehension | Vực thẳm hiểu biết: developer chưa hiểu input/output thật ở quy mô lớn. | 1 |
| Gulf of Specification | Vực thẳm đặc tả: ý định ≠ điều prompt thực sự nói. | 1 |
| Gulf of Generalization | Vực thẳm khái quát hoá: prompt rõ nhưng model vẫn áp dụng sai trên một số input. | 1 |
| Analyze–Measure–Improve | Vòng lặp eval: tìm lỗi → đo tần suất → sửa → lặp lại. | 1 |
| Guardrail | Check nằm trên đường xử lý chính để chặn / thử lại / fallback. | 1, 9 |
| Monitoring | Giám sát liên tục trong production để phát hiện drift. | 1, 9 |
| Few-shot examples | Vài cặp input/output mẫu đặt trong prompt. | 2, 12 |
| Absolute evaluation | Chấm một output độc lập theo tiêu chí (đạt/không đạt, thang điểm). | 2 |
| Comparative (pairwise) evaluation | So sánh hai output để chọn cái tốt hơn. | 2 |
| Error analysis | Phân tích lỗi: đọc trace, ghi chú, gom nhóm thành failure modes. | 3 |
| Dimensions / Tuples | Các trục biến thiên của input (vd: persona, độ khó) và tổ hợp giá trị của chúng, dùng để sinh query đa dạng. | 3 |
| Open coding | Mã hoá mở: đọc trace và ghi chú tự do về vấn đề đầu tiên thấy. | 3 |
| Axial coding | Mã hoá trục: gom các ghi chú mở thành nhóm lỗi có cấu trúc. | 3 |
| Theoretical saturation | Bão hoà: đọc thêm trace không lộ ra failure mode mới. | 3 |
| Rubric | Bộ tiêu chí chấm điểm được viết rõ ràng. | 4, 5 |
| Inter-annotator agreement (IAA) | Mức đồng thuận giữa những người gán nhãn. | 4 |
| Cohen's kappa (κ) | Chỉ số đồng thuận đã trừ phần đồng ý do ngẫu nhiên. 1 = hoàn hảo, 0 = ngang ngẫu nhiên. | 4 |
| Alignment session | Buổi họp để các annotator thống nhất cách hiểu rubric. | 4 |
| Evaluator | Bộ chấm tự động (code-based hoặc LLM-based). | 5 |
| LLM-as-judge | Dùng một LLM khác để chấm output theo tiêu chí. | 5 |
| Train / Dev / Test split | Chia dữ liệu gán nhãn: lấy few-shot / tinh chỉnh prompt judge / đo độ chính xác cuối cùng. | 5 |
| TPR (True Positive Rate) | Tỉ lệ judge nói "Pass" khi đúng là Pass. | 5 |
| TNR (True Negative Rate) | Tỉ lệ judge nói "Fail" khi đúng là Fail. | 5 |
| Bootstrap / Confidence interval | Lấy mẫu lại có hoàn lại để ước lượng khoảng tin cậy của một chỉ số. | 5 |
| Session-level / Turn-level eval | Chấm cả cuộc hội thoại vs. chấm từng lượt. | 6 |
| User simulator | LLM đóng vai người dùng để sinh hội thoại test. | 6 |
| Perturbation testing | Thay đổi nhỏ input để xem hệ thống có bền vững không. | 6 |
| RAG | Retrieval-Augmented Generation: truy xuất tài liệu rồi sinh câu trả lời. | 2, 7 |
| Precision@k / Recall@k | Trong top-k kết quả: bao nhiêu % là liên quan / lấy được bao nhiêu % tài liệu liên quan. | 7 |
| MRR | Mean Reciprocal Rank: trung bình 1/(vị trí của kết quả đúng đầu tiên). | 7 |
| NDCG@k | Chỉ số xếp hạng có trọng số theo vị trí và mức độ liên quan. | 7 |
| Chunking | Cắt tài liệu thành đoạn để index; kích thước và overlap ảnh hưởng chất lượng retrieval. | 7 |
| Tool call | LLM gọi hàm/API bên ngoài; eval theo các bước chọn tool → sinh tham số → thực thi → xử lý output. | 8 |
| Transition failure heatmap | Ma trận trạng thái-trước × trạng thái-sau, tô màu theo số lần lỗi xảy ra ở mỗi bước chuyển. | 8 |
| Prompt injection | Tấn công chèn chỉ dẫn độc hại vào input/tài liệu để điều khiển agent. | 8 |
| Regression | Thay đổi làm hỏng thứ đang chạy tốt; CI eval dùng để bắt lỗi này. | 9 |
| Judge drift | Judge thay đổi hành vi theo thời gian (đổi model, đổi phân bố data). | 9 |
| Observability | Khả năng ghi lại và truy vấn trace trong production. | 9 |
| Uncertainty sampling | Chọn trace mà evaluator ít chắc chắn nhất để người review. | 10 |
| Failure-driven sampling | Chọn trace bị flag lỗi để review. | 10 |
| Clustering | Gom trace tương tự (vd theo embedding) để tìm mẫu hình. | 10, 11 |
| EDA | Exploratory Data Analysis: phân tích khám phá dữ liệu. | 11 |
| Distillation | Chưng cất: huấn luyện model nhỏ bắt chước model lớn. | 12 |
| Model cascade | Chuỗi model rẻ → đắt; chỉ đẩy lên model đắt khi model rẻ không đủ tự tin. | 12 |
| Routing | Chọn trước model phù hợp cho từng request dựa trên đặc điểm request. | 12 |
| Calibration | Hiệu chỉnh để điểm tự tin khớp với xác suất đúng thực tế. | 12 |
| Prompt caching | Tái sử dụng phần prompt tiền tố giống nhau để giảm chi phí/latency. | 12 |