arXiv:2608.22081v1 cs.SE (Software Engineering) 22 Tháng 8, 2026
Phân tích & Tóm tắt Chuyên sâu (Lavish Review Artifact)

W-RAG: Truy xuất Nhận biết Nguồn cho Quá trình Tạo Tài liệu Doanh nghiệp từ các Cơ sở Tri thức Không đồng nhất

W-RAG: Source-Aware Retrieval for Enterprise Document Generation from Heterogeneous Knowledge Bases

Hridya Dhulipala
Đại học Texas tại Dallas (UTD)
hridya.dhulipala@utdallas.edu
Rajesh Ombase
Digital Management, LLC (DMI)
rombase@dmigs.com
Michael Wang
Viện Công nghệ Massachusetts (MIT)
wangrzm@mit.edu
Tien N. Nguyen
Đại học Texas tại Dallas (UTD)
tien.n.nyugen@utdallas.edu
Thỏa mãn Yêu cầu (vs Vanilla)
+109.2%
↑ +58.1% so với OG-RAG
Độ phù hợp Ngữ cảnh (vs Vanilla)
+96.4%
↑ +39.1% so với OG-RAG
Bộ dữ liệu & Đánh giá
100 Docs
4 Lĩnh vực × 4 Loại tài liệu
Cơ sở Tri thức & Bản thể học
4 KBs / 16
~2.000 Docs / 16 Ontologies

1.1 Bối cảnh và Động lực Nghiên cứu

Hệ thống Tạo sinh Tăng cường Truy xuất (Retrieval-Augmented Generation - RAG) đã trở thành tiêu chuẩn vàng để neo giữ các Mô hình Ngôn ngữ Lớn (LLM) vào tri thức thực tế, giảm thiểu ảo giác và nâng cao độ tin cậy. Tuy nhiên, các kiến trúc RAG hiện hành (như Vanilla RAG hay các biến thể truy xuất dày đặc) được thiết kế dựa trên giả định của truy xuất trên miền mở (open-domain retrieval): toàn bộ các đoạn tài liệu được gom chung và xếp hạng toàn cục (globally ranked) thông qua một hàm tính tương đồng đơn lẻ.

Nghịch lý "Suy sụp Nguồn" (Source Collapse) trong RAG Doanh nghiệp:

Các nghiên cứu thực tế tại doanh nghiệp (Bruckhaus 2024; Richards 2025) chỉ ra rằng có tới 73% hệ thống RAG doanh nghiệp thất bại ở các tác vụ quan trọng. Nguyên nhân: Xếp hạng toàn cục luôn thiên vị các nguồn có dung lượng lớn hơn, mật độ từ khóa dày đặc hơn, khiến cửa sổ ngữ cảnh bị thống trị bởi duy nhất 1 nguồn, đè bẹp hoàn toàn các nguồn nhỏ hơn nhưng mang tính quyết định (như pháp lý, quy chuẩn tuân thủ).

4 Chiều Không đồng nhất Cốt lõi của Tri thức Doanh nghiệp:

1 Phạm vi (Scope)

Các kho tài liệu bao quát từ chiến lược cấp tập đoàn rộng lớn đến các thông số kỹ thuật chi tiết của từng thiết bị hoặc điều khoản hợp đồng riêng lẻ.

2 Thẩm quyền (Authority)

Văn bản pháp lý và quy định bắt buộc của cơ quan quản lý (FDA, SEC) có hiệu lực tối cao, không thể bị lấn át bởi các bài báo tin tức thị trường hoặc ghi chú nội bộ.

3 Mật độ Thông tin (Density)

Các nghiên cứu khoa học và đặc tả kỹ thuật có mật độ thuật ngữ cực cao, dễ tạo điểm tương đồng vector ảo lớn hơn các tài liệu chính sách khung.

4 Vai trò Chức năng (Functional Role)

Một tài liệu hoàn chỉnh bắt buộc phải kết hợp đồng thời: Căn cứ pháp lý + Tiền lệ doanh nghiệp + Luận cứ khoa học + Định vị thị trường.

So sánh Trực quan: Cơ chế Xếp hạng Toàn cục vs. Cơ chế W-RAG Nhận biết Nguồn

Standard / Vanilla RAG (Xếp hạng Toàn cục)

Trộn tất cả các KB vào 1 chỉ mục $\to$ Tính độ tương đồng đơn $\to$ Chọn Top-$k$.

KB1 (Corporate): 85% cửa sổ ngữ cảnh [LẤN ÁT]
KB2 (Scientific): 15% cửa sổ ngữ cảnh
KB3 (Regulatory): 0% [BỊ LOẠI BỎ TOÀN BỘ]
KB4 (Market): 0% [BỊ BỎ SÓT]
⇒ Kết quả: Bản thảo thiếu tuân thủ pháp lý, không đủ điều kiện ban hành trong doanh nghiệp.
W-RAG (Phân bổ Ngữ cảnh Có Trọng số)

Định hướng Bản thể học $\to$ Xếp hạng Cục bộ từng KB $\to$ Cân bằng Ngân sách Token.

KB1 (Corporate): 35% Token Budget (3.500 tk)
KB2 (Scientific): 25% Token Budget (2.500 tk)
KB3 (Regulatory): 25% Token Budget (2.500 tk)
KB4 (Market): 15% Token Budget (1.500 tk)
⇒ Kết quả: Bản thảo cân bằng hoàn hảo, đáp ứng trọn vẹn danh mục kiểm tra yêu cầu.

2.1 Quy trình 3 Giai đoạn Chi tiết của Khung W-RAG

Giai đoạn 1 Truy xuất Ứng viên Định hướng bởi Bản thể học (Ontology-Guided Candidate Retrieval)

Chấm điểm Lai Cục bộ

Từ tài liệu yêu cầu đầu vào $q$, LLM trích xuất tập chủ đề $T = \{(t_i, g_i)\}_{i=1}^N$ (với $t_i$ là cụm từ chủ đề, $g_i$ là danh mục bản thể học). Với mỗi đoạn $c_{jk}$ trong cơ sở tri thức $\text{KB}_j$, hệ thống tính điểm phù hợp lai:

Công thức 1: Hàm liên quan lai cấp đoạn (Hybrid Relevance Function)
$$R(c_{jk}) = f_{\text{sim}}(q, c_{jk}) + \lambda f_{\text{ont}}(T, c_{jk})$$
Trong đó: $f_{\text{sim}}(q, c_{jk}) = \cos(\phi(q), \phi(c_{jk}))$ là độ tương đồng cosine vector nhúng dày đặc; $\lambda = 0.5$ là hệ số cân bằng (được tối ưu hóa cố định trên tập phát triển).
Công thức 2 & 3: Hàm tính điểm so khớp Bản thể học theo Luật (Rule-based Topic Match)
$$s(t_i, m) = \begin{cases} 1.0 & \text{nếu } t_i \text{ khớp chính xác với } m \\ 0.7 & \text{nếu một chuỗi chứa chuỗi còn lại (khớp một phần)} \\ 0.3 & \text{nếu chỉ khớp danh mục bản thể học} \\ 0 & \text{trường hợp còn lại} \end{cases}$$ $$f_{\text{ont}}(T, c_{jk}) = \frac{1}{N} \sum_{i=1}^N \max_{m \in M(c_{jk})} s(t_i, m)$$

$\implies$ Sắp xếp theo $R(c_{jk})$ để giữ lại tập $C_j = \{c_{j1}, c_{j2}, \dots, c_{jm}\}$ gồm top-$m$ đoạn ứng viên cho từng KB riêng biệt.

Giai đoạn 2 Ước lượng Trọng số Nguồn Thời gian Thực (Source Weight Estimation)

Tự động & Động

Thay vì gán trọng số tĩnh hoặc cố định, W-RAG so sánh trực tiếp các chủ đề của truy vấn hiện tại với chỉ mục chủ đề tích lũy $M_j$ của từng KB để ước lượng nhu cầu đóng góp của từng nguồn:

Công thức 5, 6 & 7: Tính điểm Nguồn và Chuẩn hóa Trọng số (%)
$$S^j_{\text{topic}} = \frac{1}{N} \sum_{i=1}^N \max_{m \in M_j} s(t_i, m), \quad S^j_{\text{doc}} = \min\left(1, \frac{N^j_{\text{doc}}}{100} \times 0.5\right), \quad S^j_{\text{cat}} \in \{0.2, 0\}$$ $$S^j_{\text{final}} = 0.7 S^j_{\text{topic}} + 0.1 S^j_{\text{doc}} + 0.2 S^j_{\text{cat}}$$ $$w_j = \frac{S^j_{\text{final}}}{\sum_{k=1}^M S^k_{\text{final}}} \times 100, \quad \text{sao cho } \sum_{j=1}^M w_j = 100\%$$

Giai đoạn 3 Xây dựng Ngữ cảnh có Trọng số & Tạo sinh (Weighted Context Construction)

Gán Ngân sách Token

Trọng số $w_j$ được chuyển thành hạn ngạch token $T_j$ trong tổng ngân sách $T_{\text{total}}$:

Công thức 8: Phân bổ Ngân sách Token & Cửa sổ Ngữ cảnh Đơn lẻ (SCW)
$$T_j = \frac{w_j}{100} \cdot T_{\text{total}}, \quad \sum_{j=1}^M T_j = T_{\text{total}}$$ $$P = \{I_{\text{sys}}, q, \text{SCW}\} \xrightarrow{\text{Inference}} \text{GPT-4.1} \xrightarrow{\text{Output}} \text{Tài liệu Doanh nghiệp Hoàn chỉnh}$$

Mỗi đoạn văn bản đưa vào SCW đều kèm siêu dữ liệu định danh nguồn gốc (provenance metadata) để LLM trích dẫn chính xác.

3.1 Bộ Dữ liệu Chuẩn Đối sánh & Hệ thống 16 Bản thể học

Do chưa có bộ dữ liệu công khai nào đánh giá RAG trong bài toán tổng hợp tài liệu doanh nghiệp dạng dài dựa trên yêu cầu, bài báo đã kỳ công xây dựng một bộ dữ liệu chuẩn mới gồm 100 tài liệu yêu cầu đầu vào được soạn thảo thủ công bởi các chuyên gia.

4 4 Loại Tài liệu Doanh nghiệp Mục tiêu

  • 1. Chính sách Doanh nghiệp (Policies): Xác định phạm vi, cấu trúc quản trị, vai trò & trách nhiệm, kiểm soát rủi ro, tuân thủ pháp luật.
  • 2. Tài liệu Ra mắt Sản phẩm (Product Launch): Kết hợp thông số kỹ thuật, nghiên cứu lâm sàng/khoa học, định vị thị trường và phê duyệt quy chuẩn.
  • 3. Báo cáo Thẩm định M&A (Due Diligence): Đánh giá tài chính, rủi ro pháp lý, kiểm toán công nghệ và tiềm năng tăng trưởng thị trường.
  • 4. Đề xuất Chương trình Học thuật (Academic Programs): Khung chương trình đào tạo, chứng nhận kiểm định, nhu cầu thị trường lao động và nguồn lực thể chế.

4 4 Cơ sở Tri thức Không đồng nhất (~2.000 tài liệu)

  • KB1 - Doanh nghiệp (Corporate): ~500 tài liệu hồ sơ SEC EDGAR, báo cáo tài chính thường niên, hướng dẫn vận hành nội bộ (Alpha Vantage).
  • KB2 - Khoa học (Scientific): ~500 bài báo nghiên cứu bình duyệt từ arXiv, NCBI/PubMed, sách trắng kỹ thuật.
  • KB3 - Pháp lý & Quy chuẩn (Regulatory): ~500 văn bản pháp quy, luật định, quy định của FDA và SEC.
  • KB4 - Thị trường & Tin tức (Market & News): ~500 báo cáo phân tích ngành, khảo sát người tiêu dùng, bài báo Forbes.

Ma trận 16 Bản thể học (Domain × Document Type Ontologies)

Được xây dựng theo quy trình bán tự động (tạo sơ bộ bằng LLM $\to$ tinh chỉnh và kiểm chứng bởi các chuyên gia trong ngành).

Lĩnh vực Công nghiệp (Domain) Chính sách (Policies) Ra mắt Sản phẩm Thẩm định M&A Chương trình Học thuật
Công nghệ AI & Media Ontology AI-POL Ontology AI-PL Ontology AI-MA Ontology AI-AP
Khí hậu & Bền vững Ontology CLIM-POL Ontology CLIM-PL Ontology CLIM-MA Ontology CLIM-AP
Y tế & Y tế từ xa Ontology HLTH-POL Ontology HLTH-PL Ontology HLTH-MA Ontology HLTH-AP
Tài chính (Finance) Ontology FIN-POL Ontology FIN-PL Ontology FIN-MA Ontology FIN-AP

Mục 5.1 Các Đường cơ sở & Thước đo Đánh giá Chi tiết (Baselines & Evaluation Metrics)

Phần trọng tâm phương pháp luận

Mục 5.1 trong bài báo thiết lập nền tảng so sánh thực nghiệm công bằng, bao gồm việc định nghĩa các đường cơ sở đối chuẩn, hệ thống 16 bản thể học, 4 thước đo đánh giá đa chiều được kiểm chứng bởi chuyên gia, và cấu hình mô hình ngôn ngữ lớn (LLM).

1 Các Thuật toán RAG Đối chuẩn (Baselines)

Vanilla RAG (Lewis et al., 2021)

Quy trình RAG tiêu chuẩn thực hiện truy xuất ngữ nghĩa dày đặc trên tất cả các cơ sở tri thức, sau đó xếp hạng toàn cục giữa các KB. Các đoạn văn bản xếp hạng cao nhất được nạp thẳng vào LLM mà không có mô hình hóa cấu trúc miền hay ưu tiên cấp nguồn.

OG-RAG (Sharma et al., 2025)

Đường cơ sở nâng cao sử dụng mô hình hóa chủ đề có định hướng bản thể học. Các tài liệu được lọc và tổ chức theo bản thể học trước khi xếp hạng toàn cục. OG-RAG đã được chứng minh vượt trội hơn cả RAPTOR (cấu trúc cây) và GraphRAG (cấu trúc đồ thị), tạo thành một đường cơ sở đối sánh cực mạnh.

W-RAG (Đề xuất)

Khung truy xuất nhận biết nguồn: kết hợp truy xuất lai định hướng bản thể học, xếp hạng cục bộ bên trong từng KB, và ước lượng trọng số nguồn động để phân bổ ngân sách token $T_j$ chính xác.

2 4 Thước đo Đánh giá Đa chiều (Evaluation Metrics)

(1) Mức độ Thỏa mãn Yêu cầu (Requirement Satisfaction - %)

Chất lượng Bản thảo

Đo lường tỷ lệ các yêu cầu thiết yếu bắt buộc được giải quyết trong tài liệu tạo ra. Không giống như bài toán hỏi đáp (QA) có câu trả lời duy nhất, văn bản doanh nghiệp được đánh giá dựa trên Danh mục kiểm tra yêu cầu (Requirement Checklist) gồm khoảng 12 mục cốt lõi do chuyên gia soạn thảo (thang điểm 0 - 1 - 2):

0: Không thỏa mãn (None)
1: Thỏa mãn một phần (Partial)
2: Hoàn toàn thỏa mãn (Full)
Bảng 2 mẫu (Chính sách): Phạm vi (3đ), Cấu trúc quản trị (3đ), Vai trò & trách nhiệm (3đ), Tiêu chuẩn pháp lý/lâm sàng (3đ), Kiểm soát rủi ro & chuyển cấp (2đ), Chỉ số chất lượng (2đ), Quy trình & lập hồ sơ (2đ), Công nghệ phê duyệt (2đ), Yêu cầu đào tạo (2đ), Kế hoạch giám sát & tuân thủ (2đ), Chu kỳ rà soát (1đ) $\implies$ Tổng 25 điểm (chuẩn hóa về 100%).

(2) Độ phù hợp Ngữ cảnh (Context Relevancy - $CTS$)

Chất lượng Truy xuất

Đo lường tỷ lệ các đoạn văn bản được truy xuất thực sự hữu ích và có liên quan đến nhiệm vụ soạn thảo:

$$CTS = \frac{1}{N} \sum_{i=1}^N z_i \quad (z_i = 1 \text{ nếu đoạn } p_i \text{ liên quan, ngược lại } z_i = 0)$$
Thước đo này giúp tách bạch rạch ròi giữa chất lượng truy xuất và chất lượng tạo sinh.

(3) Độ trung thực Cơ sở Tri thức Thực nhận (Realized Knowledge Base Fidelity)

Phân bổ Nguồn Thực tế

Xác định cơ sở tri thức nào thực sự đóng góp vào từng câu của văn bản sinh ra (thay vì chỉ so khớp từ vựng). Phân đoạn văn bản thành các câu $S = \{s_1, \dots, s_T\}$. Với mỗi câu $s_t$, tìm đoạn truy xuất khớp nhất:

$$c^*(s_t) = \arg\max_{c \in C} \cos(\phi(s_t), \phi(c))$$
Nếu $\max \cos < \tau = 0.6$ (ngưỡng Es et al., 2024), câu được gán nhãn là tổng hợp (`synthesized`) do mô hình tự suy diễn.
Phân phối thực nhận $Q_i = \frac{w_i}{\sum w_j + w_{\text{synth}}}$ (với $w_i$ là tổng số từ quy gán cho $\text{KB}_i$).

(4) Độ phân kỳ Jensen–Shannon (JSD) & Điểm Độ trung thực (Fidelity)

Đo khoảng cách Phân phối

Định lượng mức độ sai lệch giữa phân phối nguồn quy định ban đầu $P' = [P_1, \dots, P_K, 0]$ và phân phối thực nhận $Q' = [Q_1, \dots, Q_K, Q_{\text{synth}}]$:

$$JSD(P' \parallel Q') = \frac{1}{2} KL(P' \parallel M) + \frac{1}{2} KL(Q' \parallel M), \quad M = \frac{1}{2}(P' + Q')$$ $$\text{Fidelity} = 1 - \frac{JSD(P' \parallel Q')}{\ln 2} \in [0, 1]$$
Giá trị $1$ thể hiện sự tuân thủ hoàn hảo phân phối nguồn; $0$ thể hiện sự phân kỳ tối đa.

3 Mô hình Ngôn ngữ Lớn & Thẩm định Giám khảo (LLM-as-a-Judge Setup)

• Mô hình Tạo sinh (Generator LLM): Cố định mô hình GPT-4.1 (OpenAI, 2025 qua Azure AI Search) cho tất cả các đường cơ sở (Vanilla, OG-RAG, W-RAG) nhằm đảm bảo sự khác biệt về hiệu năng chỉ xuất phát từ cơ chế truy xuất.
• LLM Giám khảo (Judge LLM): Sử dụng Claude Sonnet 4.6 (Anthropic, 2026). Được thẩm định thủ công với chuyên gia và đạt độ đồng thuận vượt trội: 91% đối với Mức độ Thỏa mãn Yêu cầu và 86% đối với Độ phù hợp Ngữ cảnh.

5.2 Bảng 1: Kết quả Thực nghiệm Toàn diện trên 16 Tình huống
Đơn vị: % Thỏa mãn Yêu cầu | % Phù hợp Ngữ cảnh

Loại Tài liệu Thuật toán RAG AI & Truyền thông số Khí hậu & Bền vững Y tế & Y tế từ xa Tài chính (Finance)
Chính sách
(Policies)
Vanilla RAG 25% | 57% 38% | 32% 25% | 30% 34% | 41%
OG-RAG 34% | 73% 68% | 72% 35% | 40% 51% | 48%
W-RAG 78% | 76% 76% | 70% 55% | 70% 60% | 79%
Ra mắt Sản phẩm
(Product Launch)
Vanilla RAG 34% | 45% 35% | 40% 22% | 28% 37% | 40%
OG-RAG 38% | 74% 56% | 50% 33% | 45% 51% | 52%
W-RAG 58% | 78% 74% | 68% 63% | 71% 61% | 79%
Thẩm định M&A
(Due Diligence)
Vanilla RAG 38% | 52% 42% | 38% 20% | 32% 41% | 45%
OG-RAG 39% | 70% 54% | 49% 32% | 41% 55% | 56%
W-RAG 65% | 78% 83% | 87% 62% | 68% 73% | 82%
Chương trình Học thuật
(Academic Programs)
Vanilla RAG 28% | 31% 40% | 45% 27% | 22% 34% | 40%
OG-RAG 34% | 64% 40% | 44% 29% | 42% 45% | 52%
W-RAG 72% | 81% 78% | 82% 67% | 74% 63% | 79%

1. M&A Đạt Hiệu năng Cao Nhất

M&A đạt trung bình 70.8% Thỏa mãn Yêu cầu và 78.8% Phù hợp Ngữ cảnh dưới W-RAG (tăng +61.7% so với OG-RAG). Miền Khí hậu đạt đỉnh 83% / 87%.

2. Y Tế: Bước Tiến Đột Phá Lớn Nhất

Y tế là miền khó nhất (Vanilla chỉ đạt 23.5%). W-RAG tăng vọt lên 61.8% (+91.5% so với OG-RAG), chứng minh tính nhạy cảm cực cao với cơ cấu phân bổ nguồn.

3. Truy xuất Tốt $\neq$ Tài liệu Tốt

OG-RAG đạt ngữ cảnh 74% ở AI Product Launch nhưng Thỏa mãn Yêu cầu chỉ 38%. Chỉ khi W-RAG điều tiết tỷ lệ nguồn, điểm số mới đạt 58% / 78%.

6.1 Khả năng Điều hướng Trọng số Do Người Dùng Chỉ Định & Nghiên cứu Triệt tiêu

Một ưu điểm vượt trội khác của W-RAG là tính điều hướng được (steerability): Người dùng doanh nghiệp có thể chủ động ghi đè trọng số (weight override) để ép tài liệu sinh ra ưu tiên nhiều hơn cho một khía cạnh nghiệp vụ cụ thể.

Cấu hình Can thiệp Trọng số Trọng số Đầu vào $(w_1, w_2, w_3, w_4)$ Phân phối Thực nhận trong Tài liệu Sinh ra Độ trung thực $(1 - \frac{\text{JSD}}{\ln 2})$
Ưu tiên Doanh nghiệp (Corporate-Heavy) [70%, 10%, 10%, 10%] KB1 chiếm ưu thế áp đảo (~65%), nhấn mạnh các tiền lệ và quy chế nội bộ 0.88
Ưu tiên Pháp lý (Regulatory-Heavy) [10%, 10%, 70%, 10%] KB3 chiếm ưu thế (~68%), tài liệu tập trung cao độ vào điều khoản tuân thủ 0.91
Ưu tiên Khoa học (Scientific-Heavy) [10%, 70%, 10%, 10%] KB2 chiếm ưu thế (~62%), tài liệu đào sâu dữ liệu thực nghiệm và bằng chứng 0.84
Phân bổ Đồng đều (Equal Weights) [25%, 25%, 25%, 25%] Cân bằng cả 4 khía cạnh, tỷ lệ mỗi KB dao động 20% - 28% 0.86
Triệt tiêu Nguồn (Zero-Weighting KB3) [40%, 30%, 0%, 30%] KB3 hoàn toàn không xuất hiện ($Q_3 \approx 0\%$), không bị rò rỉ nội dung quy định 0.94

Nghiên cứu Triệt tiêu (Ablation Findings):

Vai trò của Định hướng Bản thể học ($\lambda$)

Khi bỏ $f_{\text{ont}}$ ($\lambda = 0$), Độ phù hợp Ngữ cảnh giảm 24.5% và Thỏa mãn Yêu cầu giảm 31.2%. Giá trị $\lambda = 0.5$ mang lại sự cân bằng tối ưu giữa độ tương đồng ngữ nghĩa và độ căn chỉnh chủ đề.

Xếp hạng Cục bộ vs Toàn cục

Nếu giữ nguyên định hướng bản thể học nhưng gộp xếp hạng toàn cục (không tách cục bộ từng KB), hiện tượng suy sụp nguồn vẫn xảy ra đối với các KB nhỏ hơn, làm giảm 18.6% điểm thỏa mãn yêu cầu.

Phân bổ Ngân sách Token Cấp Nguồn

Cơ chế gán hạn ngạch $T_j$ chính là chốt chặn quyết định đảm bảo sự hiện diện thực tế của từng cơ sở tri thức trong cửa sổ ngữ cảnh đơn lẻ (SCW).

7.1 Tình huống Triển khai Thực tế & Các Hạn chế Cần Lưu ý

Nghiên cứu Điển hình: Soạn thảo Hồ sơ Đề xuất Chào thầu Doanh nghiệp (RFP Proposal Drafting)

Nghiên cứu được thúc đẩy trực tiếp từ quy trình soạn thảo hồ sơ thầu thực tế tại Digital Management, LLC (DMI) giai đoạn 2025–2026 khi tham gia đấu thầu các dự án phức tạp cho Bộ Quốc phòng Hoa Kỳ (DoD) và các cơ quan dân sự liên bang:

Thách thức Đa nguồn: Một hồ sơ thầu hợp lệ bắt buộc phải lấy dữ liệu từ: (1) Hồ sơ năng lực quá khứ, (2) Bảng đơn giá & chi phí nhân sự, (3) Khung tuân thủ an ninh liên bang (NIST/FedRAMP), (4) Yêu cầu kỹ thuật riêng của từng cơ quan.
Hiệu quả Thực tiễn: W-RAG giúp các kiến trúc sư giải pháp và giám đốc đề xuất rút ngắn thời gian soạn thảo bản thảo ban đầu, đảm bảo 100% các điều khoản tuân thủ bắt buộc không bị bỏ sót do thiên lệch tìm kiếm.

Hạn chế và Định hướng Tương lai (Limitations & Future Work)

1. Quy mô Dữ liệu Mô phỏng:

Bộ chuẩn gồm 100 tài liệu yêu cầu và ~2.000 tài liệu KB, dù mang tính tiên phong, nhưng vẫn nhỏ hơn so với các kho dữ liệu quy mô petabyte thực tế của các tập đoàn lớn.

2. Tính Đa phương thức (Multimodal):

Hiện tại W-RAG tập trung vào văn bản có cấu trúc và bán cấu trúc; chưa xử lý trực tiếp bảng biểu phức tạp và sơ đồ kỹ thuật nhúng trong file PDF.

3. Chi phí Xây dựng Bản thể học:

Dù được tự động hóa một phần bằng LLM, việc kiểm duyệt 16 bản thể học vẫn cần sự can thiệp của chuyên gia miền. Hướng tương lai là tự động hóa học bản thể học liên tục.

4. Mở rộng Sang Miền Mở:

Cần kiểm chứng thêm năng lực của W-RAG trên các tác vụ hỏi đáp đa bước nhảy (multi-hop QA) và sáng tạo tự do ngoài phạm vi tài liệu doanh nghiệp.

Phụ lục Toàn diện Phụ lục Chi tiết (Full Appendix A.1 – A.7)

Chi tiết kỹ thuật & Dữ liệu bổ trợ

A.1 Chi tiết về Bộ Dữ liệu & Tài liệu Yêu cầu Đầu vào (Dataset Details)

Mỗi mẫu trong số 100 mẫu dữ liệu bắt đầu bằng một Tài liệu Yêu cầu Đầu vào (Input Requirement Document) có cấu trúc chặt chẽ, tương đồng với các bản tóm tắt nghiệp vụ (brief), ghi chú quản trị hay đặc tả phạm vi trong doanh nghiệp:

Cấu trúc 5 Thành phần của Tài liệu Yêu cầu:
  • Bối cảnh tổ chức & thể chế (Organizational background)
  • Ngữ cảnh kinh doanh & động lực thúc đẩy (Business context)
  • Các ràng buộc kỹ thuật & quy chuẩn (Constraints)
  • Đối tượng độc giả mục tiêu (Target audience)
  • Các phần bắt buộc phải có trong bản thảo cuối (Mandatory sections)
Ví dụ Mẫu trong Miền AI:

Đặc tả soạn thảo "Chính sách Quản trị Dữ liệu & Triển khai AI Doanh nghiệp" đòi hỏi quy định rõ: Giám sát con người (human-in-the-loop), kiểm soát truy cập phân quyền, bảo vệ quyền riêng tư theo GDPR/CCPA, và cơ chế chuyển cấp khi phát hiện thiên lệch mô hình.

A.2 Xây dựng Bản thể học, Trích xuất Chủ đề & Kỹ thuật Đặt Prompt

Quy trình 2 Giai đoạn Trích xuất Chủ đề:

Giai đoạn 1 (Unconstrained): LLM phân tích văn bản tự do và trích xuất các cụm từ chủ đề nổi bật dựa trên tần suất và ngữ cảnh.
Giai đoạn 2 (Ontology-Guided): Cung cấp cấu trúc bản thể học của miền vào prompt để ánh xạ các chủ đề tự do vào các danh mục hình thức ($g_i$), tạo thành tập $T = \{(t_i, g_i)\}$.
Cơ chế Cập nhật Tái lập Chỉ mục: Khi thêm tài liệu mới vào KB, quy trình trích xuất tự động chạy nền để cập nhật chỉ mục $M_j$ và số lượng tài liệu $N^j_{\text{doc}}$, đảm bảo trọng số nguồn $w_j$ tự động phản ánh kho tài liệu mới nhất.

A.3 Bảng 2: Danh mục Kiểm tra Yêu cầu Mẫu cho Tài liệu Chính sách

Mục Thiết yếu (Essential Item) Mô tả Chi tiết Điểm Tối đa
Phạm vi xác định rõ (*Scope*) Xác định rõ đối tượng áp dụng, phòng ban và hệ thống liên quan 3
Cấu trúc quản trị (*Governance*) Ủy ban giám sát, cơ chế phê duyệt và trách nhiệm giải trình 3
Vai trò & Trách nhiệm (*Roles*) Phân công cụ thể cho từng vị trí chức danh và nhóm vận hành 3
Tiêu chuẩn pháp lý / lâm sàng Dẫn chiếu chuẩn xác các quy định FDA, SEC, GDPR, ISO/IEC 3
Kiểm soát rủi ro & chuyển cấp Biện pháp giảm thiểu rủi ro và quy trình báo cáo khẩn cấp 2
Chỉ số chất lượng (*Quality metrics*) KPI, SLA và các tiêu chí đo lường hiệu quả vận hành 2
Quy trình & Lập hồ sơ Hướng dẫn thực thi từng bước và lưu trữ nhật ký kiểm toán 2
Công nghệ phê duyệt Danh mục công cụ, phần mềm và giao thức được phép sử dụng 2
Yêu cầu đào tạo Chương trình tập huấn bắt buộc cho nhân viên và nhà thầu 2
Kế hoạch giám sát tuân thủ Lịch trình kiểm toán định kỳ và biện pháp xử lý vi phạm 2
Chu kỳ rà soát chính sách Thời hạn cập nhật và xem xét lại chính sách (hàng năm/quý) 1
TỔNG CỘNG ĐIỂM: 25 điểm (100%)

A.4 & A.5 Phân tích Chi tiết Ảnh hưởng Nguồn & Độ lệch Phân phối theo Miền

Công nghệ AI & Truyền thông số:

Thể hiện sự lệch pha lớn nhất nếu dùng RAG truyền thống: Bằng chứng kỹ thuật (KB2) và tin tức (KB4) thường lấn át hoàn toàn văn bản pháp lý (KB3), khiến tài liệu thiếu hẳn các điều khoản tuân thủ an toàn AI.

Khí hậu & Tính bền vững:

Cho thấy sự ăn khớp mạnh nhất giữa phân phối chỉ định và thực nhận ($JSD \approx 0.74$). Cả KB3 (Quy chuẩn khí thải) và KB4 (Báo cáo thị trường ESG) đều đóng góp tỷ trọng cao và đồng đều.

Chăm sóc Sức khỏe & Y tế từ xa:

Là miền phức tạp nhất do yêu cầu đồng thời quy chuẩn y tế nghiêm ngặt (HIPAA/FDA), bằng chứng nghiên cứu y sinh và quy trình bệnh viện. W-RAG giúp tăng chất lượng tài liệu tới +91.5%.

Tài chính (Finance):

Bị chi phối mạnh bởi báo cáo SEC (KB1) và luật tài chính (KB3). W-RAG giữ vững tỷ lệ phân bổ, ngăn không cho tin tức thị trường làm loãng các số liệu kiểm toán tài chính bắt buộc.

A.6 & A.7 Nghiên cứu Điển hình Soạn thảo RFP & Hướng dẫn Thẩm định Chuyên gia

Nghiên cứu Điển hình tại DMI: Quy trình thực tế cho thấy các chuyên gia soạn thảo thầu phải xử lý đồng thời 5 kho dữ liệu riêng biệt. Trước khi có W-RAG, 40% thời gian của chuyên gia dành cho việc rà soát thủ công để bổ sung các điều khoản tuân thủ bị RAG bỏ sót. W-RAG đã tự động hóa việc cân bằng nguồn, giảm tỷ lệ thiếu sót tuân thủ xuống gần 0%.

Bộ Tiêu chí Thẩm định Chuyên gia (A.7): Mỗi bản thảo sinh ra được 2 chuyên gia độc lập chấm điểm theo danh mục kiểm tra. Trong trường hợp có sự sai lệch giữa điểm của chuyên gia và LLM giám khảo, một chuyên gia thứ ba sẽ tham gia hội chẩn để đưa ra điểm số đồng thuận cuối cùng.