黃妍甄
國立暨南國際大學公共行政與政策學系 助理教授
廖洲棚
國立空中大學公共行政學系 副教授
陳敦源
國立政治大學公共行政學系 教授
《摘要》
本研究針對國發會的「社會發展政策知識庫」雛形系統,發展出使用者為導向的準實驗評估方法,以檢視檢索增強生成(RAG)技術輔助公共決策的可行性與可用性。結論發現RAG技術為公共治理數位轉型帶來新視角,為確保生成式AI的效益與控制潛在風險,建議未來應結合機器與人工進行成效評估,以平衡效率與公務場域需求,並擴大知識文本資料蒐集範圍,增強系統應對多變政策環境及回應跨領域問題的能力。
關鍵字:檢索增強生成 (RAG)、生成式人工智慧、政策規劃、知識庫系統
壹、研究背景與動機
近年來,生成式人工智慧(Generative AI, GenAI)的迅速崛起,加速了AI在社會各個領域的創新應用。由於GenAI不僅能用於簡化行政流程,提升行政效率,還具有發展為支援各種公共決策的潛力。因此,在各國政府重視透過數位化轉型提升公共服務效率與品質的背景下,如何有效運用GenAI來提升政府治理效能,已成為各國發展智慧化政府的重要戰略。然而,GenAI的應用仍伴隨著多重挑戰,例如,GenAI經常會產生「幻覺」(hallucinations)的風險,即提供貌似合理但實際上錯誤的資訊(Debnath, Karmakar, & Sumon, 2024;Van Noordt, & Misuraca, 2022)。此外,由於GenAI技術門檻高且建置成本昂貴,目前在市場上廣泛使用的大型語言模型(Large Language Models, LLM)主要掌握在少數私人企業手中,這使得政府在使用GenAI時,除了需面臨系統掌控性不足的難題,還需克服資料過時(Es et. al., 2023; Gao et. al., 2024)、文本檢索不完整(Es et. al., 2023)、分析過程不透明和成果無法稽核(Earley, 2023; Gao et. al., 2024),以及洩漏機敏性資料等風險議題(Earley, 2023; Gao et. al., 2024; 蕭乃沂、楊智宇,2024)。
在此背景下,為了確保GenAI在政府部門的應用不會損害行政的專業性與機密性,行政院於2023年8月31日發布了「行政院及所屬機關(構)使用GenAI參考指引」。該指引強調了在應用GenAI時應堅守的基本原則,包括安全性、隱私性與資料治理、問責等原則。然而,由於該指引屬於行政指導,僅具政策宣示與示範性質,不具法律強制力,再加上內容涉及諸多不確定性概念與裁量空間,可能導致公務人員在實務操作中感到困惑,甚至降低使用GenAI進行業務創新的意願。為克服GenAI於行政機關應用的挑戰,資訊科學界近來已發展出檢索增強生成(Retrieval-Augmented Generation, RAG)技術,期協助行政機關運用GenAI支援公共決策時,能藉由控制政府內部資料來克服相關的風險。RAG結合了檢索和生成兩大核心功能,從組織內部文本中檢索出相關資訊,並連結GenAI背後LLM預訓練文本,企圖生成更為精準且可信的答案(Lewis et al., 2020;蕭乃沂、楊智宇,2024)。值得注意的是,雖然RAG技術具有前述的優點,但要真正的在特定的場域中發揮預期的功能還需要經過大量的調教(tuning),因為RAG系統的整體性能將受到檢索模型、使用的知識庫(corpus)、LLM或提示(prompt)內容等技術性設定細節的影響(Es et. al., 2023)。換言之,以RAG技術開發的資訊系統,必須經由一連串持續的布署、評估、調教、再布署、再評估、再調教的技術設定循環,才能使系統能逐漸符合使用者的需求。然而,評估RAG技術架構能否發揮預期的功能卻是充滿挑戰的,舉凡檢索系統能否確認文本脈絡的相關性,以及LLM的生成能否忠實地反應檢索文本的內容和生成的品質能否符合使用者需要等問題,皆非容易克服的評估難題(Es et. al., 2023)。近年來資料科學家雖已進一步發展出系統自動評估的方法,成功減少對於真實的人類註釋(human annotation)的依賴,加速RAG成效評估環節,以提高GenAI的落地運用的可行性(Es et. al., 2023)。惟缺乏使用者介入的系統優化過程,能否開發出符合不同場域使用者需求的RAG系統,其實仍不明朗。
據此,本研究旨在發展人工評估的準實驗研究途徑,針對國發會委託廠商建置的「社會發展政策知識庫」雛形系統進行概念驗證(POC),以了解以RAG技術開發的公共政策知識管理系統,能否發揮更優質的政策規劃輔助功能。對此,作者先於第二節說明本文實施的RAG系統成效評估方法,再於第三節說明成效評估的發現,並在最後一節提出本研究的發現以及後續研究的建議。
貳、準實驗設計
本研究使用的「社會發展政策知識庫」系統(以下簡稱測試系統),係由三個核心模組組成,包括資料檢索模組、連結LLM的生成模組,以及一個提供LLM所需知識的參考文本資料庫。本測試系統的資料檢索模組以及連結LLM的生成模組和文本資料庫系統,係採用意藍資訊運用RAG技術開發的「AI Search for KM」系統做為相關模組的基礎系統,再結合行政院相關機關提供的「我國少子女化對策計畫」相關文本資料以及介接目前公認效能最好的LLM-ChatGpt4o而成(如圖1所示)。測試系統能提供使用者與文本資料庫之間建立自然語言的溝通層,以便使用者能透過自然對話式的人機互動模式,查詢政策規劃過程所需的決策資訊。

圖1 AI Search for KM服務畫面。資料來源:意藍資訊。
為驗證測試系統於輔助公務人員從事政策規劃的成效,作者回顧過去RAG檢索與生成的常用評估指標得知,過去在RAG評估的指標構面上未有一定的標準,且受限於機器評估的限制,使得既有評估指標無法對於答案正確性(Answer Correctness)進行衡量。對此,作者在參酌相關文獻後,另提出一套全面性的評估指標,內容針對RAG系統的檢索功能與生成功能分別提出五個對應的評估標準,包含用於評估檢索功能的上下文召回率(Context Recall)、上下文相關性(Context Relevance)等兩項指標;和用於評估生成功能的答案相關性(Answer Relevance)、忠實度(Faithfulness)、答案正確性(Answer Correctness)等三項指標,以評估測試系統於輔助公務人員從事政策規劃工作的實際成效。
關於RAG檢索與生成評估指標的定義與題目的具體內涵,則分別說明如下。首先,在評估RAG檢索功能的部分,本研究提出的第一個評估指標為上下文召回率(Context Recal),用於評估RAG系統檢索到的參考資料和回答問題所需參考資料的關聯程度(楊君怡,2024;Katranidis & Barany, 2024: 2;Laban & Wu, 2024: 16;Zhu et al., 2024: 5)。第二個評估指標為上下文相關性(Context Relevance),用於評估RAG系統所檢索的參考資料和使用者提問的關聯程度(Hsu, 2024;Huang, 2024;Kamath et al.,2024;Shahul et al., 2023: 3;Yu et al., 2024: 5)。
其次,在RAG生成功能的部分,本研究所提出的第一個評估指標為答案相關性(Answer Relevance),意指RAG系統的回答與使用者提問的相關程度,也就是系統的回答,沒有答非所問的情況(楊君怡,2024;Kamath et al., 2024;Shahu et al., 2023)。第二個評估指標則是忠實度(Faithfulness),意指RAG系統的回答能忠實反映系統檢索出的文本內容,也就是系統的回答能有所本,而非胡言亂語(Huang, 2024; Chiu, 2023; Shahul etal.,2023)。而第三個評估指標為答案正確性(Answer Correctness),意指RAG系統的回答與標準答案一致的程度(Chiu, 2023; Chen et al., 2024; Yu et al., 2024)。
值得一提的是,為評估測試系統的答案正確性,本研究根據研究委託單位國發會的建議,選擇「我國少子女化對策計畫」的相關內容做為內容驗證標的。因此,本研究藉由建構我國少子女化對策計畫的常見問答集(FAQ)做為使用者評估測試系統生成答案與正確答案一致程度的判斷基礎。為確保本研究使用的FAQ的正確性,作者先根據行政院核定的「我國少子女化對策計畫(107年-114年)」內容草擬涵蓋各子計畫內容的36題FAQ,並由國發會協助以公文的方式,函請該計畫的相關權責機關根據負責之業務項目修正或補充作者草擬的FAQ初稿。在權責機關的協助下,本研究最終建立43題關於我國少子女化對策計畫的FAQ內容。
最後,關於本研究設計的準實驗評估係根據下列步驟執行。作者先根據前述的評估指標設計成效評估量表,並在正式評估前舉行專家效度會議,以確保實驗設計的適當性和RAG成效評估量表的信效度。其次,在實驗參與者的選擇上,係採取自願報名的途徑遴選受試者。報名方式係由國發會協助於前揭的同一函文邀請「實際負責規劃或執行之資深同仁或科長級以上主管」公務人員參與實驗。所有參與實驗的公務人員,在參與前皆已詳閱本研究的實驗評估說明,並了解參與實驗的權利與義務後,自行報名參與並提供完整的聯絡資訊,故符合研究倫理要求的受試者知情同意規範。本研究總計有22位公務人員參與,每位負責1至6題FAQ的RAG成效評估。最後,在實驗實施的程序上,本研究提供實驗參考指引,引導受試者配合分配的FAQ題目進行測試系統操作,並依序驗證測試系統於相關評估指標的表現,再由受試者根據評估結果填寫至Google網路問卷製作的成效評估量表。本文總計完成兩次實驗評估,兩次實驗評估的結果,接續於下一節說明。
參、結合生成式AI與RAG的知識管理具體流程及案例
為了評估 AI Search for KM 系統在優化與改進後的成效,本研究於2024年12月31日前共完成兩次實驗。第一次實驗於2024年11月18日至12月12日舉行,作者以電郵通知所有受試者根據預擬的實驗指引進行實驗,接著研究團隊依照第一次實驗結果進行測試系統功能的優化與知識庫文本的補充(由受試者提供)。在完成第一次實驗後的測試系統優化及知識庫文本補充作業後,作者再次藉由電郵通知受試者進行第二次實驗,實驗期間為2024年12月17日至12月24日,實驗評估結果整理如表1所示。本研究從受測者第一次實驗的的質性回饋中發現,系統在搜尋功能、互動邏輯、資料完整性與功能範圍等四個層面的不足。首先,在搜尋功能方面,系統對於使用者輸入的複雜問題或具體關鍵詞無法進行精準檢索,回覆內容常以「無法完整回答」作為結論。例如,當使用者查詢「兒童健康相關政策」或「國民健康署有哪些政策」時,系統未能提供相關資訊。此外,FAQ資料庫的覆蓋範圍有限,進一步限制了使用者獲取答案的能力。其次,在互動邏輯上,系統缺乏上下文記憶功能,使用者需每次重新啟動「新增問答任務」以確保後續問題的正確回答。系統僅能回答事實性問題(如「政府做了什麼」),對於推理性或分析性問題(如「為什麼要做」或「有什麼好處」)無法提供有效回應,顯示其對複雜問題的應對能力不足。最後,第一次實驗結果顯示測試系統的資料完整性與準確性仍有待提升,與「我國少子女化對策計畫」相關的文本資料仍有不足,例如「強化社會安全網第一期計畫核定本」未被納入。同時,部分資料存在錯別字與冗餘內容,不僅降低了資料的專業性,還影響了使用者對系統回覆的信任度。最後,在功能範圍上,系統未能有效整合跨政策領域的成果與內容,例如婦幼友善政策與少子女化政策的綜合探討未被充分納入,這使得使用者無法獲取多元的政策資訊。
對此,在收集相關意見後,本研究則針對系統在資料來源、內容準確性與回覆能力等方面的不足,本研究在第二次實驗前完成了下列的改進措施,期提升系統的覆蓋率與回覆準確性,並解決受試者發現的相關問題,包含(1)補充資料來源:為提升系統回覆的覆蓋率與準確性,本研究收集並上傳實驗受測者的回饋資料,擴充系統的資料來源。透過增加與查詢問題相關的參考資料,進一步完善資料庫內容,使系統能更精準地生成符合使用者需求的回覆;(2)資料去重複處理:為確保資料檢索效率,團隊對資料庫內部的相同內容進行了去重複處理。重複資料由於來源不同可能增加檔案冗餘性,因此選擇保留結構清晰、易於查詢的版本,減少資料重複對系統效能的影響;(3)雜訊移除與資料預處理:在進一步優化資料庫時,研究團隊對檔案進行了預處理,移除了網頁選單、圖片等雜訊元素。此舉不僅降低了資料庫的雜訊比例,還使系統生成回覆時更專注於主要內容,從而提升回覆品質與精確度。
為比較兩次實驗結果的差異,作者採用成對樣本t檢定(Paired Sample t test)進行分析。首先,在檢索品質的部分,「上下文召回率」由第一次實驗的平均數為2.91分,提升至第二次實驗平均數3.37分,而「上下文相關性」亦由第一次實驗的平均數3.09分,提升第二次實驗平均數3.58分,整體來看,「檢索品質」的部分,由第一次實驗平均數3.00分,提升至第二次實驗平均數3.48分。其次,在生成品質的部分,「答案相關性」第一次實驗的平均數為2.58分,第二次實驗的平均數為2.98分,「忠實度」由第一次實驗的平均數為2.95分,第二次實驗的平均數為3.02分,而「答案正確性」第一次實驗的平均數為2.23分,第二次實驗的平均數為2.58分,整體來看,「生成品質」的部分,由第一次實驗平均數2.59分,提升至第二次實驗平均數2.86分。最後,在AI Search for KM系統服務滿意度的部分,由第一次實驗與第二次實驗的平均分數均為2.14分,兩次實驗結果在服務滿意度分數並沒有差異。值得注意的是,奠基於上述修正與優化,系統的回答率也從第一次實驗的23題增加至第二次實驗的33題,回覆率由52% 提升至76%。整體而言,從總平均來看,第一次實驗的平均數為2.75分,第二次實驗的平均數為3.11,惟兩次實驗結果在多項評估指標的數值上雖呈現上升趨勢,但皆未達到統計上的顯著水準。

說明:上述題目共43題,選項均採0-5分之計算。
肆、結論與建議
從前述的討論中可知,RAG技術的出現不但為GenAI在公共決策上的應用帶來嶄新的可能性,更為公共治理的數位化轉型帶來全新的視野。本研究的主要貢獻,在針對以RAG技術發展的「社會發展政策知識庫」系統,提出以使用者為導向的成效評估方法,除可補充系統自動評估欠缺的使用者回饋資訊外,更有助於行政機關據以完整地且透明地檢視以RAG技術開發的政策知識庫於輔助公共決策的可行性與可用性。隨著世界各國競相探索應用GenAI於加速政府數位轉型、建構智慧政府的此刻,未來該如何確保GenAI的帶來的正面效益並控制潛在的風險,則是公共管理者必須審慎面對的嚴肅議題。據此,本研究提出以下建議:首先,未來應發展結合機器與人工進行成效評估的方式,以確保系統發展方向能平衡發效率與切合公務場域的需求。本研究提出使用者參與的成效評估方法,可以協助系統開發者根據使用者的回饋意見來調教系統,以持續改進系統功能,使其符合公務人員的使用習慣和需求;其次,為了增強AI系統在多變政策環境中的應對能力,未來應在政府可控制知識庫的前提下,擴展知識文本資料的蒐集程序與蒐集範圍,以利公務人員提供更多跨領域的政策文件和研究資料的意願,俾提升系統回應跨領域問題的廣度與生成知識的正確度。
參考文獻
Chiu, Bowen. (2023)。做了一個RAG系統品質幾分啦?相關性、真實性、上下文精確性、正確性。Ragas全自動打分。Medium. https://medium.com/@bohachu/做了一個rag系統品質幾分-相關性-真實性-上下文精確性-正確性-ragas全自動打分-be1b7dc925d8
Huang, Chi Chieh. (2024)。深入解析 RAG 評估框架:TruLens, RGAR, 與 RAGAs 的比較。Medium. https://medium.com/@cch.chichieh/深入解析-rag-評估框架-trulens-rgar-與-ragas-的比較-ab70d7117480
楊君怡(2024)。掌握 RAG 評估框架:RAGAS 八大指標一篇看完。資料探員。https://idataagent.com/2024/05/27/mastering-rag-assessment-skills-from-beginner-to-expert/.
Chen, J., Lin, H., Han, X., & Sun, L. (2024). Benchmarking Large Language Models in Retrieval-Augmented Generation. In Proceedings of the AAAI Conference on Artificial Intelligence, 38(16), 17754-17762.
Debnath, P., Karmakar, M., & Sumon, M. F. I. (2024). AI in Public Policy: Enhancing Decision-Making and Policy Formulation in the US Government. International Journal of Advanced Engineering Technologies and Innovations, 2(1), 169-193.
Earley, S. (2023). What Executives Need to Know about Knowledge Management, Large Language Models and Generative AI. Applied Marketing Analysis, 9(3), 215-229.
Es, S., James, J., Espinosa-Anke, L., & Schockaert, S. (2023). Ragas: Automated evaluation of retrieval augmented generation. arXiv preprint arXiv,2309.15217, 150-158.
Gao, Y. et al. (2023) Retrieval-Augmented Generation for Large Language Models: A Survey. arXiv preprint arXiv, 2312.10997, 1-21.
Kamath, U., Keenan, K., Somers, G., & Sorenson, S. (2024). Retrieval-Augmented Generation. In Large Language Models: A Deep Dive: Bridging Theory and Practice. 275-313. Cham: Springer Nature Switzerland.
Katranidis, V., & Barany, G. (2024). FaaF: Facts as a Function for the evaluation of RAG systems. arXiv preprint arXiv, 2403.03888, 1-14.
Laban, P., Fabbri, A. R., Xiong, C., & Wu, C. S. (2024). Summary of a Haystack: A Challenge to Long-Context Llms and RAG Systems. arXiv preprint arXiv,2407.01370, 1-18.
Nielsen, J. (1994). Usability Inspection Methods. in Conference Companion on Human Factors in Computing Systems (pp. 413-414).
Van Noordt, C., & Misuraca, G. (2022). Artificial Intelligence for the Public Sector: Results of Landscaping the Use of AI In Government across the European Union. Government information quarterly, 39(3), 101714.
Yu, H., Gan, A., Zhang, K., Tong, S., Liu, Q., & Liu, Z. (2024). Evaluation of Retrieval-Augmented Generation: A Survey. arXiv preprint arXiv, 2405.07437, 1-21.
Zhu, K., Luo, Y., Xu, D., Wang, R., Yu, S., Wang, Shi Yu & Sun, M. (2024). RAGEval: Scenario Specific RAG Evaluation Dataset Generation Framework. arXiv preprint arXiv,2408.01262, 1-18.
