朝日新聞社宣布,其媒體研究開發中心成員所撰寫的研究論文,已獲選於自然語言處理領域權威國際會議「ACL 2026」(第64屆年會)主議程中發表。

本論文由媒體研究開發中心研究員川畑輝擔任主作者,提出了一種名為「Cooperative yet Critical reward modeling(C2)」的新手法,旨在更精確地評估大型語言模型(LLM)生成回答的品質。

隨著生成式AI的普及,如何有效評估AI生成回答的準確度成為了一項關鍵挑戰。本研究透過應用評分準則(Rubric)來穩定並優化評估標準,展示了一種創新的評價技術,預計將對提升生成式AI的可靠性做出貢獻。

【C2手法概要】 為了應對當前評估手法的挑戰,研究團隊引入了兩個分工不同的AI:負責提出評分準則的AI,以及利用這些準則來判定回答優劣的AI。透過迭代生成、評估多項基準,並從中學習,系統能自動收集引導模型做出更精準決策的配對數據(Pairwise data)。

【研究成果】 實驗數據顯示,C2手法在評估精準度上超越了傳統手法。此外,實驗亦確認,在C2架構下進行學習的AI模型,其性能表現甚至達到了參考由規模約為其四倍的AI所生成之評分準則的水準。

此項研究成果預計將於2026年7月2日7日在美國聖地牙哥舉行的ACL 2026會議上正式發表。

FACT BOX · 重點整理

  • 來源:PR TIMES
  • 分類:調查
  • 原文日期2026年7月2日-7日 (ACL 2026開催期間)
  • 產品、服務:C2 (Cooperative yet Critical reward modeling)