多模態模型在「觀看」影片方面取得了驚人的進展。它們現在能夠為短片生成字幕、回答關於畫面內容的問題,甚至能從數小時的影片中搜尋特定片段。然而,當要求模型追蹤長達兩小時的訪談中人物動機的轉變,或是理解日語中一個簡單的「嗯嗯啊啊」(相槌)所蘊含的細微差別時,難度便會急劇升高。

今天,我們發布的「NARU Bench(Narrative And cultural Reasoning Understanding)」正是為了應對這些挑戰而生。它是一個開放的基準測試,旨在衡量在真實日本媒體中真正重要的「影片理解能力」,並揭示現有模型與人類水平之間存在的差距。本基準測試由 InfiniMind 與 東京大學 共同研究開發。

NARU Bench 目前已在 Hugging Face 和 GitHub 上公開,可使用 lmms-eval 立即執行。

為何需要此基準測試?

日本國內的影片內容市場預計在2025年達到約6,300億日圓(約40億美元)。這類內容不僅規模龐大,而且極度高語境(high-context)。許多意義是透過現場氣氛、間接表達和人際關係動態來傳達,而非僅僅透過口語表達。要評估 AI 系統是否真正理解這些內容,需要一種遠超簡單物體識別或片段式問答的方法。

現有的影片基準測試雖然推動了該領域的發展,但存在一些共同的盲點:

過度偏重英語: 大多數現有基準測試使用英語內容,很少驗證非英語媒體以及其中所需的「文化推理能力」。

偏重短片與搜尋: 即使是長影片基準測試,許多也僅測量模型搜尋或回憶明確資訊的能力,而不考驗其在時間軸上保持連貫敘事模型的能力。

低語境假設: 依賴於重要資訊以淺顯方式陳述的媒體,因此無法衡量對隱含的社會線索和文化根源意義的理解。

NARU Bench 則聚焦於這兩項最艱鉅的挑戰——長篇敘事追蹤與高語境文化推理的交集,並使用真實的日語影片進行評估。

NARU Bench 概述

本基準測試包含 1,481 個多選題,源自 155 部日語 YouTube 影片。內容涵蓋訪談、對談、脫口秀等形式,時長從 30 分鐘到 240 分鐘不等,總計約 147 小時。所有問題和選項均以日語書寫,必須實際觀看影片才能答對。這些問題的設計旨在確保僅憑文字記錄或語言預備知識無法回答。

基準測試分為兩個軌道和九種任務類型:

敘事理解力(745 題)

文化理解力(736 題)

資料集建構方法

建構方法的詳細資訊將在即將發布的論文中闡述,重點如下:

來源數據: 在約 10 萬部影片的資料池中,透過自動語音辨識(ASR)篩選出以日語為主的內容,並根據播放時間(30 分鐘以上)過濾,縮小到約 8,000 部候選影片。隨後,審核人員從影片的完整性、敘事連續性、社會互動和意義多樣性等方面,精選出最終的資料集。

標註與問答生成: 我們建立了一個基於代理的標註平台,將長影片分割成片段,同時透過分層記憶機制保持片段間的敘事連續性。結構化標註(存在、事件、敘事線、文化線索)被輸入到基於約束的問答生成器中。在反覆的去偏見循環中,我們包含了一個盲測解題者,嘗試不觀看影片來回答每個問題,以偵測並修正那些僅憑文字即可解答的問題。

人工驗證: 所有問題均由日語母語人士確認其準確性、相關性、難易度,以及是否真正需要理解影片內容。

評估結果:現有模型面臨的障礙

我們在包含 1,481 個問題的基準測試中評估了多個模型。

結果顯而易見。當有四個選項時,隨機猜測的正確率為 25%——而一些領先的開放權重模型僅僅勉強超過這個水平。我們測試中最強大的通用開放權重模型也僅達到 33.9%。我們的 DeepFrame 8B 達到 32.1%,與 Qwen3-Omni 等規模大得多的 30B 模型相當。但真正值得注意的是平台級別的結果。我們的 DeepFrame Platform 結合了影片全局檢索(retrieval)和代理推理,達到了我們測試的所有系統中最高的 55.3%。這約為最佳單體模型的 1.6 倍。儘管如此,距離可靠的人類級別理解仍有巨大差距。NARU Bench 非常困難,這正是它的意義所在。它揭示了通用影片問答中從未顯現的敘事理解和文化推理的失敗。

立即試用

NARU Bench 已直接整合至 lmms-eval,無需 fork 即可輕鬆執行。

資料集可在 infinimind/naru_benchmark 找到。您可以一次執行所有任務,或評估個別子任務(例如:narubench-cultural-2.1.aizuchi)。來源影片以 ID 引用。需要歸檔副本的研究人員可以透過資料集卡片中的連結申請存取權限。

關於共同開發

NARU Bench 由 InfiniMind 和 東京大學 共同開發。它是在日本政府主導的旨在加強日本 AI 基礎模型開發的 GENIAC(Generative AI Accelerator Challenge)計畫背景下建立的。NARU Bench 提供了一個評估基礎,用於理解日語媒體,這是英語為中心的基準測試無法觸及的領域。

未來展望

擴充來源數據——從 YouTube 擴展到日本電視和結構化廣播媒體。

改進方法——持續改進自動化流程和人工驗證。

發布論文——我們正在準備一篇論文,總結建構、方法和全面評估。

NARU Bench 從今天起公開。我們希望這個基準測試能對所有需要處理真實日語影片——不僅是識別畫面內容,更要理解其意義——的多模態模型開發者和評估者有所幫助。

📦 資料集: huggingface.co/datasets/infinimind/naru_benchmark

💻 程式碼: github.com/infinimind-inc/naru_benchmark

資料集(問題、選項、元數據)根據 CC BY-NC-SA 4.0 發布。評估程式碼根據 Apache-2.0 發布。引用的影片遵循原始創作者和 YouTube 的使用條款。

公司簡介

公司名稱:InfiniMind Inc(日本分公司:インフィニマインド株式会社 (舊)SDio株式会社)

代表者:代表取締役 カイ アバ

設立:2024年11月

所在地:214 Homer Ave, Palo Alto, CA 94301 USA(日本分公司:東京都千代田區大手町)

業務內容:開發及提供大規模影片基礎模型、企業級 AI 搜尋平台

網址:https://infinimind.io

【關於 InfiniMind】

InfiniMind 正在建構專注於影片的 AI 基礎設施,將全球龐大的影片數據轉換為可供商業利用的「結構化數據」。由曾在 Google 領導影片推薦研究和數據科學團隊的創始成員領軍,我們致力於最先進的長影片模型(LVM)的研究開發。自 2024 年 11 月正式啟動以來,我們已獲選參與經濟產業省的生成 AI 開發支援計畫 GENIAC 第三期、Google、NVIDIA 等大型平台新創計畫,並成為日本僅有的兩家入選 AWS GAIA 2025(Generative AI Accelerator)的公司之一。我們正從深度科技的最前線出發,以日本為據點,致力於透過確立影片基礎模型的全球標準來改變世界市場。

我們正在積極招募夥伴,一同在全球競爭。請透過 Linkedin 或以下電子郵件聯繫我們。

關於本案的諮詢窗口

電子郵件:[email protected]

FACT BOX · 重點整理

  • 來源:PR TIMES
  • 分類:技術
  • 相關組織:InfiniMind / 東京大学 / Google