RAG giải quyết đúng một phần của bài toán
Retrieval-augmented generation giúp mô hình có thêm tài liệu liên quan trước khi trả lời. Điều đó hữu ích khi kiến thức thay đổi nhanh hoặc không nên nhồi hết vào prompt. Nhưng RAG không tự biến tài liệu thành sự thật, cũng không tự ngăn việc truy vấn nhầm vùng dữ liệu. Phần khó vẫn là thiết kế ranh giới.
Bốn ranh giới cần đặt trước
- Dữ liệu nào được lập chỉ mục và ai được phép tìm thấy nó?
- Một yêu cầu được phép tiêu tốn bao nhiêu thời gian và tài nguyên?
- Khi không có bằng chứng đủ mạnh, hệ thống sẽ trả lời thế nào?
- Làm sao xóa hoặc thay thế một tài liệu mà không để bản cũ tiếp tục xuất hiện?
Đưa phần rẻ và chắc chắn ra edge
Edge phù hợp với những bước có thể dự đoán: kiểm tra kích thước yêu cầu, chuẩn hóa locale, lọc quyền truy cập, đọc cache và ghi lại một mã truy vết. Những bước này nên chạy trước khi gọi mô hình. Chúng giảm công việc vô ích, đồng thời tạo một điểm quan sát ổn định dù nhà cung cấp AI có thay đổi.
Một chỉ mục nhỏ nhưng có chủ đích
Không cần đưa mọi thứ vào kho tìm kiếm ngay từ đầu. Chọn nhóm tài liệu có vòng đời rõ ràng, giữ metadata về chủ sở hữu và ngày hiệu lực, rồi kiểm tra kết quả bằng các câu hỏi mà người dùng thật sự đặt ra. Một tập tài liệu nhỏ, được cập nhật đúng, thường đáng tin hơn một kho lớn không ai chịu trách nhiệm.
- Chia tài liệu theo không gian làm việc và quyền truy cập.
- Lưu nguồn, phiên bản và thời điểm hiệu lực cùng mỗi đoạn.
- Kiểm tra kết quả không chỉ bằng độ tương đồng mà cả phạm vi quyền.
- Đặt quy trình tái lập chỉ mục khi tài liệu bị thay thế hoặc xóa.
Chi phí là một thuộc tính của sản phẩm
Trên gói miễn phí, mỗi lời gọi không cần thiết đều làm giảm dư địa cho người dùng thật. Vì vậy nên đo và giới hạn từ sớm: độ dài đầu vào, số đoạn truy xuất, số lần thử lại và thời gian chờ. Khi vượt ngưỡng, giao diện nên nói rõ rằng câu trả lời cần thu hẹp phạm vi, thay vì âm thầm gửi thêm yêu cầu.
Câu trả lời an toàn có thể là không biết
Nếu các đoạn tìm được không đủ liên quan, hãy trả lại một câu hỏi làm rõ hoặc thông báo chưa có dữ liệu. Gắn nguồn vào phần trả lời, tách suy luận khỏi trích dẫn và không cho phép mô hình tự bịa đường dẫn nội bộ. Khả năng từ chối đúng lúc là một phần của UX, không phải lỗi cần che giấu.
RAG đáng tin cậy không hứa trả lời mọi thứ; nó biết dữ liệu nào được phép nói và khi nào nên dừng lại.
Kết luận
Một kiến trúc edge-first hợp lý thường bắt đầu rất nhỏ: kiểm tra và phân quyền ở Worker, dữ liệu có vòng đời ở lớp lưu trữ, tìm kiếm với giới hạn, rồi mới gọi mô hình khi bằng chứng đủ. Thiết kế này giữ cho chi phí, quyền riêng tư và khả năng thay nhà cung cấp nằm trong tay đội ngũ, ngay cả khi hệ thống lớn dần.

