Tra cứu

Thuật ngữ RAG

Giải thích ngắn gọn các khái niệm xuất hiện trong khoá học, kèm bài học liên quan.

Thuật ngữÝ nghĩaBài
RAG (Retrieval-Augmented Generation)Truy xuất tài liệu liên quan rồi đưa vào prompt để LLM trả lời dựa trên đó.1
HallucinationMô hình tạo ra thông tin nghe hợp lý nhưng sai hoặc không có căn cứ.1
Indexing / lập chỉ mụcPha chuẩn bị: nạp, làm sạch, chia chunk, embed và lưu tài liệu.1
ChunkMột đoạn nhỏ của tài liệu — đơn vị được embed, truy xuất và đưa vào prompt.2
Overlap / chồng lấnPhần nội dung lặp lại giữa hai chunk liền kề để không mất ý ở ranh giới.2
MetadataThông tin đi kèm chunk: nguồn, mục, phiên bản, ngày, phòng ban, nhóm quyền.2
Parent–child (small-to-big)Tìm bằng chunk nhỏ, đưa vào prompt đoạn cha lớn hơn chứa nó.2
TokenĐơn vị văn bản mà mô hình xử lý; giới hạn ngữ cảnh và chi phí tính theo token.2
EmbeddingVector số biểu diễn ý nghĩa của văn bản; văn bản gần nghĩa có vector gần nhau.3
Cosine similarityĐộ tương đồng theo góc giữa hai vector: a·b / (‖a‖‖b‖).3
Vector storeHệ lưu trữ và tìm kiếm vector theo độ gần, thường kèm lọc metadata.3
ANN (Approximate Nearest Neighbor)Tìm láng giềng gần đúng, đổi một chút độ chính xác lấy tốc độ.3
HNSWChỉ mục ANN dạng đồ thị nhiều tầng; nhanh, recall cao, tốn bộ nhớ.3
ef_searchSố ứng viên HNSW giữ lại khi đi xuống đồ thị. Đặt thấp thì điều kiện lọc chặt sẽ trả về ít dòng hơn số bạn yêu cầu.3
Dense retrievalTruy xuất bằng embedding (ngữ nghĩa).4
Sparse retrieval / BM25Truy xuất theo từ khoá, chấm điểm theo tần suất và độ hiếm của từ.4
TF-IDFTrọng số từ = tần suất trong đoạn × độ hiếm trên toàn kho; nền tảng của tìm kiếm từ khoá cổ điển.Lab
Hybrid searchKết hợp dense và sparse retrieval rồi hợp nhất kết quả.4
RRF (Reciprocal Rank Fusion)Hợp nhất nhiều danh sách xếp hạng bằng Σ 1/(k + rank).4
Top-kSố đoạn có điểm cao nhất được giữ lại sau truy xuất.4
Reranker / cross-encoderMô hình đọc câu hỏi và đoạn cùng lúc để chấm lại mức liên quan, chính xác hơn nhưng chậm.4
MMR (Maximal Marginal Relevance)Chọn đoạn vừa liên quan vừa khác các đoạn đã chọn, tránh trùng lặp.4
HyDESinh câu trả lời giả định rồi dùng nó để truy xuất thay cho câu hỏi.4
Multi-querySinh nhiều cách diễn đạt câu hỏi, truy xuất từng cách rồi hợp nhất.4
Context windowLượng token tối đa mô hình đọc được trong một lần gọi.5
Lost in the middleXu hướng mô hình bỏ sót thông tin nằm giữa ngữ cảnh dài.5
Grounding / trích dẫnGắn mỗi ý trong câu trả lời với nguồn cụ thể trong ngữ cảnh.5
Prompt injectionVăn bản (có thể nằm trong tài liệu truy xuất) cố điều khiển mô hình làm trái chỉ dẫn.5
Golden setBộ câu hỏi có đáp án và đoạn liên quan chuẩn dùng để đánh giá.6
Recall@kTỉ lệ đoạn liên quan nằm trong top-k kết quả.6
MRRTrung bình nghịch đảo thứ hạng của đoạn liên quan đầu tiên.6
nDCGChỉ số xếp hạng có tính tới mức độ liên quan và vị trí, chuẩn hoá về 0–1.6
FaithfulnessMức độ câu trả lời được ngữ cảnh hỗ trợ, không thêm thắt.6
LLM-as-judgeDùng LLM chấm điểm câu trả lời theo rubric; cần đối chiếu với người chấm.6
Contextual retrievalGhép câu tóm tắt ngữ cảnh do LLM viết vào từng chunk trước khi embed.7
Agentic RAGLLM tự lập kế hoạch truy xuất nhiều bước, chọn công cụ và nguồn.7
GraphRAGXây đồ thị thực thể–quan hệ từ tài liệu để trả lời câu hỏi tổng quan.7