1.1 Bối cảnh và Động lực Nghiên cứu
Hệ thống Tạo sinh Tăng cường Truy xuất (Retrieval-Augmented Generation - RAG) đã trở thành tiêu chuẩn vàng để neo giữ các Mô hình Ngôn ngữ Lớn (LLM) vào tri thức thực tế, giảm thiểu ảo giác và nâng cao độ tin cậy. Tuy nhiên, các kiến trúc RAG hiện hành (như Vanilla RAG hay các biến thể truy xuất dày đặc) được thiết kế dựa trên giả định của truy xuất trên miền mở (open-domain retrieval): toàn bộ các đoạn tài liệu được gom chung và xếp hạng toàn cục (globally ranked) thông qua một hàm tính tương đồng đơn lẻ.
Nghịch lý "Suy sụp Nguồn" (Source Collapse) trong RAG Doanh nghiệp:
Các nghiên cứu thực tế tại doanh nghiệp (Bruckhaus 2024; Richards 2025) chỉ ra rằng có tới 73% hệ thống RAG doanh nghiệp thất bại ở các tác vụ quan trọng. Nguyên nhân: Xếp hạng toàn cục luôn thiên vị các nguồn có dung lượng lớn hơn, mật độ từ khóa dày đặc hơn, khiến cửa sổ ngữ cảnh bị thống trị bởi duy nhất 1 nguồn, đè bẹp hoàn toàn các nguồn nhỏ hơn nhưng mang tính quyết định (như pháp lý, quy chuẩn tuân thủ).
4 Chiều Không đồng nhất Cốt lõi của Tri thức Doanh nghiệp:
Các kho tài liệu bao quát từ chiến lược cấp tập đoàn rộng lớn đến các thông số kỹ thuật chi tiết của từng thiết bị hoặc điều khoản hợp đồng riêng lẻ.
Văn bản pháp lý và quy định bắt buộc của cơ quan quản lý (FDA, SEC) có hiệu lực tối cao, không thể bị lấn át bởi các bài báo tin tức thị trường hoặc ghi chú nội bộ.
Các nghiên cứu khoa học và đặc tả kỹ thuật có mật độ thuật ngữ cực cao, dễ tạo điểm tương đồng vector ảo lớn hơn các tài liệu chính sách khung.
Một tài liệu hoàn chỉnh bắt buộc phải kết hợp đồng thời: Căn cứ pháp lý + Tiền lệ doanh nghiệp + Luận cứ khoa học + Định vị thị trường.
So sánh Trực quan: Cơ chế Xếp hạng Toàn cục vs. Cơ chế W-RAG Nhận biết Nguồn
Trộn tất cả các KB vào 1 chỉ mục $\to$ Tính độ tương đồng đơn $\to$ Chọn Top-$k$.
Định hướng Bản thể học $\to$ Xếp hạng Cục bộ từng KB $\to$ Cân bằng Ngân sách Token.
2.1 Quy trình 3 Giai đoạn Chi tiết của Khung W-RAG
Giai đoạn 1 Truy xuất Ứng viên Định hướng bởi Bản thể học (Ontology-Guided Candidate Retrieval)
Chấm điểm Lai Cục bộTừ tài liệu yêu cầu đầu vào $q$, LLM trích xuất tập chủ đề $T = \{(t_i, g_i)\}_{i=1}^N$ (với $t_i$ là cụm từ chủ đề, $g_i$ là danh mục bản thể học). Với mỗi đoạn $c_{jk}$ trong cơ sở tri thức $\text{KB}_j$, hệ thống tính điểm phù hợp lai:
$\implies$ Sắp xếp theo $R(c_{jk})$ để giữ lại tập $C_j = \{c_{j1}, c_{j2}, \dots, c_{jm}\}$ gồm top-$m$ đoạn ứng viên cho từng KB riêng biệt.
Giai đoạn 2 Ước lượng Trọng số Nguồn Thời gian Thực (Source Weight Estimation)
Tự động & ĐộngThay vì gán trọng số tĩnh hoặc cố định, W-RAG so sánh trực tiếp các chủ đề của truy vấn hiện tại với chỉ mục chủ đề tích lũy $M_j$ của từng KB để ước lượng nhu cầu đóng góp của từng nguồn:
Giai đoạn 3 Xây dựng Ngữ cảnh có Trọng số & Tạo sinh (Weighted Context Construction)
Gán Ngân sách TokenTrọng số $w_j$ được chuyển thành hạn ngạch token $T_j$ trong tổng ngân sách $T_{\text{total}}$:
Mỗi đoạn văn bản đưa vào SCW đều kèm siêu dữ liệu định danh nguồn gốc (provenance metadata) để LLM trích dẫn chính xác.
3.1 Bộ Dữ liệu Chuẩn Đối sánh & Hệ thống 16 Bản thể học
Do chưa có bộ dữ liệu công khai nào đánh giá RAG trong bài toán tổng hợp tài liệu doanh nghiệp dạng dài dựa trên yêu cầu, bài báo đã kỳ công xây dựng một bộ dữ liệu chuẩn mới gồm 100 tài liệu yêu cầu đầu vào được soạn thảo thủ công bởi các chuyên gia.
4 4 Loại Tài liệu Doanh nghiệp Mục tiêu
- 1. Chính sách Doanh nghiệp (Policies): Xác định phạm vi, cấu trúc quản trị, vai trò & trách nhiệm, kiểm soát rủi ro, tuân thủ pháp luật.
- 2. Tài liệu Ra mắt Sản phẩm (Product Launch): Kết hợp thông số kỹ thuật, nghiên cứu lâm sàng/khoa học, định vị thị trường và phê duyệt quy chuẩn.
- 3. Báo cáo Thẩm định M&A (Due Diligence): Đánh giá tài chính, rủi ro pháp lý, kiểm toán công nghệ và tiềm năng tăng trưởng thị trường.
- 4. Đề xuất Chương trình Học thuật (Academic Programs): Khung chương trình đào tạo, chứng nhận kiểm định, nhu cầu thị trường lao động và nguồn lực thể chế.
4 4 Cơ sở Tri thức Không đồng nhất (~2.000 tài liệu)
- KB1 - Doanh nghiệp (Corporate): ~500 tài liệu hồ sơ SEC EDGAR, báo cáo tài chính thường niên, hướng dẫn vận hành nội bộ (Alpha Vantage).
- KB2 - Khoa học (Scientific): ~500 bài báo nghiên cứu bình duyệt từ arXiv, NCBI/PubMed, sách trắng kỹ thuật.
- KB3 - Pháp lý & Quy chuẩn (Regulatory): ~500 văn bản pháp quy, luật định, quy định của FDA và SEC.
- KB4 - Thị trường & Tin tức (Market & News): ~500 báo cáo phân tích ngành, khảo sát người tiêu dùng, bài báo Forbes.
Ma trận 16 Bản thể học (Domain × Document Type Ontologies)
Được xây dựng theo quy trình bán tự động (tạo sơ bộ bằng LLM $\to$ tinh chỉnh và kiểm chứng bởi các chuyên gia trong ngành).
| Lĩnh vực Công nghiệp (Domain) | Chính sách (Policies) | Ra mắt Sản phẩm | Thẩm định M&A | Chương trình Học thuật |
|---|---|---|---|---|
| Công nghệ AI & Media | Ontology AI-POL | Ontology AI-PL | Ontology AI-MA | Ontology AI-AP |
| Khí hậu & Bền vững | Ontology CLIM-POL | Ontology CLIM-PL | Ontology CLIM-MA | Ontology CLIM-AP |
| Y tế & Y tế từ xa | Ontology HLTH-POL | Ontology HLTH-PL | Ontology HLTH-MA | Ontology HLTH-AP |
| Tài chính (Finance) | Ontology FIN-POL | Ontology FIN-PL | Ontology FIN-MA | Ontology FIN-AP |
Mục 5.1 Các Đường cơ sở & Thước đo Đánh giá Chi tiết (Baselines & Evaluation Metrics)
Phần trọng tâm phương pháp luậnMục 5.1 trong bài báo thiết lập nền tảng so sánh thực nghiệm công bằng, bao gồm việc định nghĩa các đường cơ sở đối chuẩn, hệ thống 16 bản thể học, 4 thước đo đánh giá đa chiều được kiểm chứng bởi chuyên gia, và cấu hình mô hình ngôn ngữ lớn (LLM).
1 Các Thuật toán RAG Đối chuẩn (Baselines)
Quy trình RAG tiêu chuẩn thực hiện truy xuất ngữ nghĩa dày đặc trên tất cả các cơ sở tri thức, sau đó xếp hạng toàn cục giữa các KB. Các đoạn văn bản xếp hạng cao nhất được nạp thẳng vào LLM mà không có mô hình hóa cấu trúc miền hay ưu tiên cấp nguồn.
Đường cơ sở nâng cao sử dụng mô hình hóa chủ đề có định hướng bản thể học. Các tài liệu được lọc và tổ chức theo bản thể học trước khi xếp hạng toàn cục. OG-RAG đã được chứng minh vượt trội hơn cả RAPTOR (cấu trúc cây) và GraphRAG (cấu trúc đồ thị), tạo thành một đường cơ sở đối sánh cực mạnh.
Khung truy xuất nhận biết nguồn: kết hợp truy xuất lai định hướng bản thể học, xếp hạng cục bộ bên trong từng KB, và ước lượng trọng số nguồn động để phân bổ ngân sách token $T_j$ chính xác.
2 4 Thước đo Đánh giá Đa chiều (Evaluation Metrics)
(1) Mức độ Thỏa mãn Yêu cầu (Requirement Satisfaction - %)
Chất lượng Bản thảoĐo lường tỷ lệ các yêu cầu thiết yếu bắt buộc được giải quyết trong tài liệu tạo ra. Không giống như bài toán hỏi đáp (QA) có câu trả lời duy nhất, văn bản doanh nghiệp được đánh giá dựa trên Danh mục kiểm tra yêu cầu (Requirement Checklist) gồm khoảng 12 mục cốt lõi do chuyên gia soạn thảo (thang điểm 0 - 1 - 2):
(2) Độ phù hợp Ngữ cảnh (Context Relevancy - $CTS$)
Chất lượng Truy xuấtĐo lường tỷ lệ các đoạn văn bản được truy xuất thực sự hữu ích và có liên quan đến nhiệm vụ soạn thảo:
(3) Độ trung thực Cơ sở Tri thức Thực nhận (Realized Knowledge Base Fidelity)
Phân bổ Nguồn Thực tếXác định cơ sở tri thức nào thực sự đóng góp vào từng câu của văn bản sinh ra (thay vì chỉ so khớp từ vựng). Phân đoạn văn bản thành các câu $S = \{s_1, \dots, s_T\}$. Với mỗi câu $s_t$, tìm đoạn truy xuất khớp nhất:
(4) Độ phân kỳ Jensen–Shannon (JSD) & Điểm Độ trung thực (Fidelity)
Đo khoảng cách Phân phốiĐịnh lượng mức độ sai lệch giữa phân phối nguồn quy định ban đầu $P' = [P_1, \dots, P_K, 0]$ và phân phối thực nhận $Q' = [Q_1, \dots, Q_K, Q_{\text{synth}}]$:
3 Mô hình Ngôn ngữ Lớn & Thẩm định Giám khảo (LLM-as-a-Judge Setup)
5.2
Bảng 1: Kết quả Thực nghiệm Toàn diện trên 16 Tình huống
Đơn vị: % Thỏa mãn Yêu cầu | % Phù hợp Ngữ cảnh
| Loại Tài liệu | Thuật toán RAG | AI & Truyền thông số | Khí hậu & Bền vững | Y tế & Y tế từ xa | Tài chính (Finance) |
|---|---|---|---|---|---|
| Chính sách (Policies) |
Vanilla RAG | 25% | 57% | 38% | 32% | 25% | 30% | 34% | 41% |
| OG-RAG | 34% | 73% | 68% | 72% | 35% | 40% | 51% | 48% | |
| W-RAG | 78% | 76% | 76% | 70% | 55% | 70% | 60% | 79% | |
| Ra mắt Sản phẩm (Product Launch) |
Vanilla RAG | 34% | 45% | 35% | 40% | 22% | 28% | 37% | 40% |
| OG-RAG | 38% | 74% | 56% | 50% | 33% | 45% | 51% | 52% | |
| W-RAG | 58% | 78% | 74% | 68% | 63% | 71% | 61% | 79% | |
| Thẩm định M&A (Due Diligence) |
Vanilla RAG | 38% | 52% | 42% | 38% | 20% | 32% | 41% | 45% |
| OG-RAG | 39% | 70% | 54% | 49% | 32% | 41% | 55% | 56% | |
| W-RAG | 65% | 78% | 83% | 87% | 62% | 68% | 73% | 82% | |
| Chương trình Học thuật (Academic Programs) |
Vanilla RAG | 28% | 31% | 40% | 45% | 27% | 22% | 34% | 40% |
| OG-RAG | 34% | 64% | 40% | 44% | 29% | 42% | 45% | 52% | |
| W-RAG | 72% | 81% | 78% | 82% | 67% | 74% | 63% | 79% |
1. M&A Đạt Hiệu năng Cao Nhất
M&A đạt trung bình 70.8% Thỏa mãn Yêu cầu và 78.8% Phù hợp Ngữ cảnh dưới W-RAG (tăng +61.7% so với OG-RAG). Miền Khí hậu đạt đỉnh 83% / 87%.
2. Y Tế: Bước Tiến Đột Phá Lớn Nhất
Y tế là miền khó nhất (Vanilla chỉ đạt 23.5%). W-RAG tăng vọt lên 61.8% (+91.5% so với OG-RAG), chứng minh tính nhạy cảm cực cao với cơ cấu phân bổ nguồn.
3. Truy xuất Tốt $\neq$ Tài liệu Tốt
OG-RAG đạt ngữ cảnh 74% ở AI Product Launch nhưng Thỏa mãn Yêu cầu chỉ 38%. Chỉ khi W-RAG điều tiết tỷ lệ nguồn, điểm số mới đạt 58% / 78%.
6.1 Khả năng Điều hướng Trọng số Do Người Dùng Chỉ Định & Nghiên cứu Triệt tiêu
Một ưu điểm vượt trội khác của W-RAG là tính điều hướng được (steerability): Người dùng doanh nghiệp có thể chủ động ghi đè trọng số (weight override) để ép tài liệu sinh ra ưu tiên nhiều hơn cho một khía cạnh nghiệp vụ cụ thể.
| Cấu hình Can thiệp Trọng số | Trọng số Đầu vào $(w_1, w_2, w_3, w_4)$ | Phân phối Thực nhận trong Tài liệu Sinh ra | Độ trung thực $(1 - \frac{\text{JSD}}{\ln 2})$ |
|---|---|---|---|
| Ưu tiên Doanh nghiệp (Corporate-Heavy) | [70%, 10%, 10%, 10%] | KB1 chiếm ưu thế áp đảo (~65%), nhấn mạnh các tiền lệ và quy chế nội bộ | 0.88 |
| Ưu tiên Pháp lý (Regulatory-Heavy) | [10%, 10%, 70%, 10%] | KB3 chiếm ưu thế (~68%), tài liệu tập trung cao độ vào điều khoản tuân thủ | 0.91 |
| Ưu tiên Khoa học (Scientific-Heavy) | [10%, 70%, 10%, 10%] | KB2 chiếm ưu thế (~62%), tài liệu đào sâu dữ liệu thực nghiệm và bằng chứng | 0.84 |
| Phân bổ Đồng đều (Equal Weights) | [25%, 25%, 25%, 25%] | Cân bằng cả 4 khía cạnh, tỷ lệ mỗi KB dao động 20% - 28% | 0.86 |
| Triệt tiêu Nguồn (Zero-Weighting KB3) | [40%, 30%, 0%, 30%] | KB3 hoàn toàn không xuất hiện ($Q_3 \approx 0\%$), không bị rò rỉ nội dung quy định | 0.94 |
Nghiên cứu Triệt tiêu (Ablation Findings):
Khi bỏ $f_{\text{ont}}$ ($\lambda = 0$), Độ phù hợp Ngữ cảnh giảm 24.5% và Thỏa mãn Yêu cầu giảm 31.2%. Giá trị $\lambda = 0.5$ mang lại sự cân bằng tối ưu giữa độ tương đồng ngữ nghĩa và độ căn chỉnh chủ đề.
Nếu giữ nguyên định hướng bản thể học nhưng gộp xếp hạng toàn cục (không tách cục bộ từng KB), hiện tượng suy sụp nguồn vẫn xảy ra đối với các KB nhỏ hơn, làm giảm 18.6% điểm thỏa mãn yêu cầu.
Cơ chế gán hạn ngạch $T_j$ chính là chốt chặn quyết định đảm bảo sự hiện diện thực tế của từng cơ sở tri thức trong cửa sổ ngữ cảnh đơn lẻ (SCW).
7.1 Tình huống Triển khai Thực tế & Các Hạn chế Cần Lưu ý
Nghiên cứu Điển hình: Soạn thảo Hồ sơ Đề xuất Chào thầu Doanh nghiệp (RFP Proposal Drafting)
Nghiên cứu được thúc đẩy trực tiếp từ quy trình soạn thảo hồ sơ thầu thực tế tại Digital Management, LLC (DMI) giai đoạn 2025–2026 khi tham gia đấu thầu các dự án phức tạp cho Bộ Quốc phòng Hoa Kỳ (DoD) và các cơ quan dân sự liên bang:
Hạn chế và Định hướng Tương lai (Limitations & Future Work)
Bộ chuẩn gồm 100 tài liệu yêu cầu và ~2.000 tài liệu KB, dù mang tính tiên phong, nhưng vẫn nhỏ hơn so với các kho dữ liệu quy mô petabyte thực tế của các tập đoàn lớn.
Hiện tại W-RAG tập trung vào văn bản có cấu trúc và bán cấu trúc; chưa xử lý trực tiếp bảng biểu phức tạp và sơ đồ kỹ thuật nhúng trong file PDF.
Dù được tự động hóa một phần bằng LLM, việc kiểm duyệt 16 bản thể học vẫn cần sự can thiệp của chuyên gia miền. Hướng tương lai là tự động hóa học bản thể học liên tục.
Cần kiểm chứng thêm năng lực của W-RAG trên các tác vụ hỏi đáp đa bước nhảy (multi-hop QA) và sáng tạo tự do ngoài phạm vi tài liệu doanh nghiệp.
Phụ lục Toàn diện Phụ lục Chi tiết (Full Appendix A.1 – A.7)
Chi tiết kỹ thuật & Dữ liệu bổ trợA.1 Chi tiết về Bộ Dữ liệu & Tài liệu Yêu cầu Đầu vào (Dataset Details)
Mỗi mẫu trong số 100 mẫu dữ liệu bắt đầu bằng một Tài liệu Yêu cầu Đầu vào (Input Requirement Document) có cấu trúc chặt chẽ, tương đồng với các bản tóm tắt nghiệp vụ (brief), ghi chú quản trị hay đặc tả phạm vi trong doanh nghiệp:
- Bối cảnh tổ chức & thể chế (Organizational background)
- Ngữ cảnh kinh doanh & động lực thúc đẩy (Business context)
- Các ràng buộc kỹ thuật & quy chuẩn (Constraints)
- Đối tượng độc giả mục tiêu (Target audience)
- Các phần bắt buộc phải có trong bản thảo cuối (Mandatory sections)
Đặc tả soạn thảo "Chính sách Quản trị Dữ liệu & Triển khai AI Doanh nghiệp" đòi hỏi quy định rõ: Giám sát con người (human-in-the-loop), kiểm soát truy cập phân quyền, bảo vệ quyền riêng tư theo GDPR/CCPA, và cơ chế chuyển cấp khi phát hiện thiên lệch mô hình.
A.2 Xây dựng Bản thể học, Trích xuất Chủ đề & Kỹ thuật Đặt Prompt
Quy trình 2 Giai đoạn Trích xuất Chủ đề:
A.3 Bảng 2: Danh mục Kiểm tra Yêu cầu Mẫu cho Tài liệu Chính sách
| Mục Thiết yếu (Essential Item) | Mô tả Chi tiết | Điểm Tối đa |
|---|---|---|
| Phạm vi xác định rõ (*Scope*) | Xác định rõ đối tượng áp dụng, phòng ban và hệ thống liên quan | 3 |
| Cấu trúc quản trị (*Governance*) | Ủy ban giám sát, cơ chế phê duyệt và trách nhiệm giải trình | 3 |
| Vai trò & Trách nhiệm (*Roles*) | Phân công cụ thể cho từng vị trí chức danh và nhóm vận hành | 3 |
| Tiêu chuẩn pháp lý / lâm sàng | Dẫn chiếu chuẩn xác các quy định FDA, SEC, GDPR, ISO/IEC | 3 |
| Kiểm soát rủi ro & chuyển cấp | Biện pháp giảm thiểu rủi ro và quy trình báo cáo khẩn cấp | 2 |
| Chỉ số chất lượng (*Quality metrics*) | KPI, SLA và các tiêu chí đo lường hiệu quả vận hành | 2 |
| Quy trình & Lập hồ sơ | Hướng dẫn thực thi từng bước và lưu trữ nhật ký kiểm toán | 2 |
| Công nghệ phê duyệt | Danh mục công cụ, phần mềm và giao thức được phép sử dụng | 2 |
| Yêu cầu đào tạo | Chương trình tập huấn bắt buộc cho nhân viên và nhà thầu | 2 |
| Kế hoạch giám sát tuân thủ | Lịch trình kiểm toán định kỳ và biện pháp xử lý vi phạm | 2 |
| Chu kỳ rà soát chính sách | Thời hạn cập nhật và xem xét lại chính sách (hàng năm/quý) | 1 |
| TỔNG CỘNG ĐIỂM: | 25 điểm (100%) | |
A.4 & A.5 Phân tích Chi tiết Ảnh hưởng Nguồn & Độ lệch Phân phối theo Miền
Thể hiện sự lệch pha lớn nhất nếu dùng RAG truyền thống: Bằng chứng kỹ thuật (KB2) và tin tức (KB4) thường lấn át hoàn toàn văn bản pháp lý (KB3), khiến tài liệu thiếu hẳn các điều khoản tuân thủ an toàn AI.
Cho thấy sự ăn khớp mạnh nhất giữa phân phối chỉ định và thực nhận ($JSD \approx 0.74$). Cả KB3 (Quy chuẩn khí thải) và KB4 (Báo cáo thị trường ESG) đều đóng góp tỷ trọng cao và đồng đều.
Là miền phức tạp nhất do yêu cầu đồng thời quy chuẩn y tế nghiêm ngặt (HIPAA/FDA), bằng chứng nghiên cứu y sinh và quy trình bệnh viện. W-RAG giúp tăng chất lượng tài liệu tới +91.5%.
Bị chi phối mạnh bởi báo cáo SEC (KB1) và luật tài chính (KB3). W-RAG giữ vững tỷ lệ phân bổ, ngăn không cho tin tức thị trường làm loãng các số liệu kiểm toán tài chính bắt buộc.
A.6 & A.7 Nghiên cứu Điển hình Soạn thảo RFP & Hướng dẫn Thẩm định Chuyên gia
Nghiên cứu Điển hình tại DMI: Quy trình thực tế cho thấy các chuyên gia soạn thảo thầu phải xử lý đồng thời 5 kho dữ liệu riêng biệt. Trước khi có W-RAG, 40% thời gian của chuyên gia dành cho việc rà soát thủ công để bổ sung các điều khoản tuân thủ bị RAG bỏ sót. W-RAG đã tự động hóa việc cân bằng nguồn, giảm tỷ lệ thiếu sót tuân thủ xuống gần 0%.
Bộ Tiêu chí Thẩm định Chuyên gia (A.7): Mỗi bản thảo sinh ra được 2 chuyên gia độc lập chấm điểm theo danh mục kiểm tra. Trong trường hợp có sự sai lệch giữa điểm của chuyên gia và LLM giám khảo, một chuyên gia thứ ba sẽ tham gia hội chẩn để đưa ra điểm số đồng thuận cuối cùng.