NTT公司確立了一項名為「依據增強解碼」(Evidence-Enhanced Decoding)的技術,旨在提高處理圖像與語言的多模態AI基礎模型輸出的可靠性。針對LVLM在進行思維鏈(CoT)推理時傾向於忽略自身生成的推理依據這一問題,該技術與傳統推理不同,將基於圖像的推理與基於依據的推理分開,並進行加權組合。這使得模型能夠忠實地利用來自圖像與依據雙方的資訊來輸出答案。此項成果將於2026年6月3日至6月7日在美國丹佛舉行的計算機視覺領域頂級國際會議CVPR 2026上發表。背景方面,近年來LVLM發展迅速,實現了高度的多模態推理,但現有的CoT機制將依據的使用交由模型自行決定,無法保證依據與最終輸出的一致性。本研究確立了一種無需額外訓練的隨插即用型推理時解碼技術,成功賦予了LVLM推理過程可解釋性。這有望加速其在醫療影像診斷、決策支援等需要高度可靠推理系統領域的社會應用。
FACT BOX · 重點整理
- 來源:PR TIMES
- 分類:technical_announcement
- 相關組織:NTT
- 原文日期:2026年6月3日 / 2026年6月7日