Tham khảo Thuật ngữ

Bảng thuật ngữ Anh–Việt

Glossary of evaluation terms
Thuật ngữTiếng Việt / giải thíchChương
AgentPhần do LLM điều khiển: suy luận, gọi tool, sinh output. Từ 1 lần gọi LLM đến vòng lặp nhiều bước.1, 2
ApplicationMọi thứ bao quanh agent: UI, DB, API, hạ tầng.1
TraceBản ghi đầy đủ những gì agent làm cho một request (input, các bước, tool call, output).1, 3
Failure modeKiểu hỏng / dạng lỗi lặp lại được đặt tên rõ ràng.3
Gulf of ComprehensionVực thẳm hiểu biết: developer chưa hiểu input/output thật ở quy mô lớn.1
Gulf of SpecificationVực thẳm đặc tả: ý định ≠ điều prompt thực sự nói.1
Gulf of GeneralizationVực thẳm khái quát hoá: prompt rõ nhưng model vẫn áp dụng sai trên một số input.1
Analyze–Measure–ImproveVòng lặp eval: tìm lỗi → đo tần suất → sửa → lặp lại.1
GuardrailCheck nằm trên đường xử lý chính để chặn / thử lại / fallback.1, 9
MonitoringGiám sát liên tục trong production để phát hiện drift.1, 9
Few-shot examplesVài cặp input/output mẫu đặt trong prompt.2, 12
Absolute evaluationChấm một output độc lập theo tiêu chí (đạt/không đạt, thang điểm).2
Comparative (pairwise) evaluationSo sánh hai output để chọn cái tốt hơn.2
Error analysisPhân tích lỗi: đọc trace, ghi chú, gom nhóm thành failure modes.3
Dimensions / TuplesCác trục biến thiên của input (vd: persona, độ khó) và tổ hợp giá trị của chúng, dùng để sinh query đa dạng.3
Open codingMã hoá mở: đọc trace và ghi chú tự do về vấn đề đầu tiên thấy.3
Axial codingMã hoá trục: gom các ghi chú mở thành nhóm lỗi có cấu trúc.3
Theoretical saturationBão hoà: đọc thêm trace không lộ ra failure mode mới.3
RubricBộ tiêu chí chấm điểm được viết rõ ràng.4, 5
Inter-annotator agreement (IAA)Mức đồng thuận giữa những người gán nhãn.4
Cohen's kappa (κ)Chỉ số đồng thuận đã trừ phần đồng ý do ngẫu nhiên. 1 = hoàn hảo, 0 = ngang ngẫu nhiên.4
Alignment sessionBuổi họp để các annotator thống nhất cách hiểu rubric.4
EvaluatorBộ chấm tự động (code-based hoặc LLM-based).5
LLM-as-judgeDùng một LLM khác để chấm output theo tiêu chí.5
Train / Dev / Test splitChia dữ liệu gán nhãn: lấy few-shot / tinh chỉnh prompt judge / đo độ chính xác cuối cùng.5
TPR (True Positive Rate)Tỉ lệ judge nói "Pass" khi đúng là Pass.5
TNR (True Negative Rate)Tỉ lệ judge nói "Fail" khi đúng là Fail.5
Bootstrap / Confidence intervalLấy mẫu lại có hoàn lại để ước lượng khoảng tin cậy của một chỉ số.5
Session-level / Turn-level evalChấm cả cuộc hội thoại vs. chấm từng lượt.6
User simulatorLLM đóng vai người dùng để sinh hội thoại test.6
Perturbation testingThay đổi nhỏ input để xem hệ thống có bền vững không.6
RAGRetrieval-Augmented Generation: truy xuất tài liệu rồi sinh câu trả lời.2, 7
Precision@k / Recall@kTrong top-k kết quả: bao nhiêu % là liên quan / lấy được bao nhiêu % tài liệu liên quan.7
MRRMean Reciprocal Rank: trung bình 1/(vị trí của kết quả đúng đầu tiên).7
NDCG@kChỉ số xếp hạng có trọng số theo vị trí và mức độ liên quan.7
ChunkingCắt tài liệu thành đoạn để index; kích thước và overlap ảnh hưởng chất lượng retrieval.7
Tool callLLM gọi hàm/API bên ngoài; eval theo các bước chọn tool → sinh tham số → thực thi → xử lý output.8
Transition failure heatmapMa trận trạng thái-trước × trạng thái-sau, tô màu theo số lần lỗi xảy ra ở mỗi bước chuyển.8
Prompt injectionTấn công chèn chỉ dẫn độc hại vào input/tài liệu để điều khiển agent.8
RegressionThay đổi làm hỏng thứ đang chạy tốt; CI eval dùng để bắt lỗi này.9
Judge driftJudge thay đổi hành vi theo thời gian (đổi model, đổi phân bố data).9
ObservabilityKhả năng ghi lại và truy vấn trace trong production.9
Uncertainty samplingChọn trace mà evaluator ít chắc chắn nhất để người review.10
Failure-driven samplingChọn trace bị flag lỗi để review.10
ClusteringGom trace tương tự (vd theo embedding) để tìm mẫu hình.10, 11
EDAExploratory Data Analysis: phân tích khám phá dữ liệu.11
DistillationChưng cất: huấn luyện model nhỏ bắt chước model lớn.12
Model cascadeChuỗi model rẻ → đắt; chỉ đẩy lên model đắt khi model rẻ không đủ tự tin.12
RoutingChọn trước model phù hợp cho từng request dựa trên đặc điểm request.12
CalibrationHiệu chỉnh để điểm tự tin khớp với xác suất đúng thực tế.12
Prompt cachingTái sử dụng phần prompt tiền tố giống nhau để giảm chi phí/latency.12