Thực hành
Phòng thí nghiệm RAG thu nhỏ
Một pipeline RAG hoàn chỉnh chạy ngay trong trình duyệt trên bộ tài liệu nội quy của công ty giả định “Sao Mai”: chia chunk → vector hoá → truy xuất top-k → dựng prompt. Thay đổi tham số và quan sát kết quả thay đổi thế nào.
Lưu ý về “embedding” trong phòng thí nghiệm
Để chạy không cần máy chủ, lab dùng vector TF-IDF (dựa trên từ xuất hiện chung) thay cho mô hình embedding thật.
Vì vậy nó xử lý tốt câu hỏi dùng đúng từ trong tài liệu nhưng sẽ bỏ lỡ câu hỏi đồng nghĩa — hãy thử câu gợi ý thứ năm để thấy giới hạn này,
và xem lại Embedding & vector store và Truy xuất.
Câu hỏi
Tham số
Bộ tài liệu
Kết quả truy xuất
Prompt gửi tới LLM
Đây là thứ mô hình thực sự đọc. Không có đoạn nào vượt ngưỡng thì hệ thống nên từ chối thay vì gọi mô hình.
Gợi ý thí nghiệm
Mọi con số dưới đây đọc thẳng từ trang này ở thiết lập mặc định (chunk 40, chồng lấn 8, top-k 3, ngưỡng 0,05, có gắn tiêu đề), trừ khi ghi khác.
-
Câu hỏi mặc định. Đoạn hạng 1 là
hr-remote#2với cosine 0,299, và đọc kỹ thì đoạn này chứa đủ cả “thử việc” lẫn “quản lý trực tiếp phê duyệt” — tức là trả lời được câu hỏi. Đoạnhr-remote#1xếp sau với 0,245 tuy nó mới là phần đầu tài liệu. Thứ tự trong tài liệu và thứ tự liên quan là hai chuyện khác nhau. - Giảm kích thước chunk xuống 15 từ. Kho đi từ 20 chunk lên 84 chunk. Mỗi đoạn ngắn hơn nên đặc hơn, nhưng cũng mang theo ít ngữ cảnh xung quanh hơn — hãy xem đoạn hạng 1 lúc đó còn đủ ý để trả lời không.
- Hỏi câu đồng nghĩa “Tôi muốn ở nhà làm việc được không?”. Đoạn đúng vẫn xếp hạng 1 nhưng điểm rơi xuống 0,023 — thấp hơn 13 lần so với 0,299 của cách hỏi thẳng, và thấp hơn cả ngưỡng mặc định 0,05, nên lab từ chối trả lời. Đây mới là điều đáng chú ý: TF-IDF không xếp sai, nó chỉ mất gần hết độ tự tin. Một mô hình embedding thật sẽ tìm ra đoạn này.
-
Tắt “Gắn tiêu đề tài liệu vào chunk”. Chiều thay đổi phụ thuộc câu hỏi, rất đáng tự xem:
với sáu câu hỏi mẫu, gắn tiêu đề làm điểm nhích lên hoặc xuống chưa tới 0,04 — vì tiêu đề kéo dài vector bằng những từ câu hỏi không dùng tới.
Nhưng gõ
chế độ nghỉ phép nămthì tiêu đề đáng giá +0,242 (0,483 so với 0,241), cònchính sách bảo mật thông tinđáng giá +0,285 (0,502 so với 0,217). Tiêu đề phát huy khi câu hỏi nhắc tới chủ đề của tài liệu, chứ không phải lúc nào cũng có lợi. - Tăng top-k từ 3 lên 8. Ngữ cảnh đi từ 146 từ lên 374 từ, khoảng 2,6 lần, vì cả tám đoạn đều vượt ngưỡng 0,05 nên không đoạn nào bị loại — hãy đếm trong tám đoạn đó có mấy đoạn thật sự liên quan. Đó là cái giá phải trả cho recall. (Làm đúng thí nghiệm này trên bộ tài liệu tiếng Anh thì ngữ cảnh KHÔNG đổi: ở đó các đoạn hạng 4–8 đều dưới ngưỡng và bị bỏ. Cùng tham số, khác dữ liệu, khác kết quả — đó là lý do phải đo trên chính dữ liệu của mình.)
- Hỏi thứ không có trong tài liệu (“Công ty có hỗ trợ gửi xe không?”). Điểm cao nhất là 0,122; kéo ngưỡng lên trên mức đó là hệ thống từ chối. Để ý nó vẫn xếp hạng được — luôn luôn có một thứ tự. Chỉ có ngưỡng mới biến “đoạn tốt nhất trong một mớ tệ” thành “không biết”.