株式會社TEN PROXY(總部:東京都,代表取締役:武道 誠芳)宣布啟動元評估AI平台「eval000(エバル・トリプルゼロ)」事業,並作為第一彈推出評估外包服務「eval000 Essential」。

評估AI現況:Lv3瓶頸

生成式AI的評估自動化在過去一兩年內迅速進入實裝階段。在商業計畫、人事評估及企業審查等領域,利用LLM進行評分與回饋生成的導入案例日益增加。

然而,若將自動駕駛的SAE等級分類映射到評估AI上,會發現現今許多系統僅止於「Lv3」。

▲ Lv3的結構性問題:道德擠壓區(Moral Crumple Zone)

儘管評分已自動化,但仍需由人類持續判斷「是否能信賴該結果」。

即使使用評估AI,判斷的責任仍歸屬於人類。研究者Madeleine Elish將此結構稱為「道德擠壓區(責任緩衝墊化的人類)」。

eval000以元評估引擎應對此問題。

eval000的Lv4設計—分三層自動化

eval000的元評估引擎將評估分解為三個層級。Layer 01至02無需人類介入即可完成的設計,是達到Lv4的根據。

Layer

角色

處理

內容

負責區分

Lv3(參考)

評分自動化

評分+建議判斷

人類持續判斷結果的可信度

等待後援

Layer 01

感測器輸入

一次評估

由AI Persona評審員進行評分

AI Persona評審員

自動化

Layer 02

駕駛行為

收斂處理

由元評估引擎計算標準評分

元評估引擎

自動化

Layer 03

目的地設定

原理設定

最終判斷

設定與最終決定評估目的與方針

人類(恆常性)

恆常性

人類

「無論自動駕駛汽車多麼自主,目的地仍由乘客指定。駕駛行為的自動化與目的地設定的自動化是完全不同的問題。」

— 摘自eval000.ai 技術探討文章「評估的自動駕駛,現今何合目—從審查AI與eval000看HITL的真正意義」

此設計意味著從Human-in-the-Loop(AI的即時核准)轉向Human-in-Command(專注於原理設定與最終判斷的人類)。

「eval000 Essential」概要與特點

元評估AI平台

eval000 Essential保留了eval000元評估引擎的核心技術,並以評估外包服務的形式提供,無需年約或專業知識。我們以更簡潔、更快速、更易於使用的形式,將元評估的價值傳遞給各種評估現場,如競賽評審、補助金審查、人才招募評估等。

主要特點

Persona評審員的多角度評估:具有不同評估傾向的AI Persona評審員,如重視創新者、重視實績者、重視平衡者、重視協調者等,進行平行評估。透過固定點收斂,達成相同的標準評分。

基於評分標準的個別回饋:根據評分標準(Rubric)生成高度個人化的回饋意見。

評估方針的初步明確化(Layer 03):在開始前將審查目的與方針明確化為「外生原理」。Essential在商業競賽領域的標準(預設)方針為「評估在四年內有潛力達到種子輪至A輪階段的早期事業可行性」。

簡易啟動與明確的收費標準:NDA可透過電子簽名最快當日完成。免費報價。商業競賽領域免設定費,採用階段性單價(¥1,800〜¥5,000/件)的易於使用的價格設計。

主要應用場景

商業競賽、加速器計畫的審查

企業內部新事業審查、內部創業制度

補助金、獎勵金的核准審查

人才招募評估、內部表彰制度

與award-of聯動

本公司營運的「award-of(award-of.net)」是Award Force在日本的正規合作夥伴,Award Force是源自澳洲、導入於50多個國家、全球領先的獎項管理SaaS。透過整合eval000與award-of,實現報名管理、標準評分計算、回饋自動發送的一站式審查DX。

評估的結構性課題

偏見:因審查員的專業領域與經驗不同,評估標準差異大,即使是相同的提案也可能導致評分分歧。

雜訊:即使是同一審查員,也會因審查時機與順序不同而導致分數波動。根據Kahneman等人的研究,平均變動幅度為19%

AI的個性:即使使用生成式AI進行評估,不同模型也會有其評估上的「個性」。本公司PoC在同一提案上,不同模型之間曾出現最高12分(滿分100分)的差異。

誤差:評分標準(Rubric)的設計需要專業性,容易流於個人化或形式化。

代表取締役 武道 誠芳 評論

「透過award-of事業參與了眾多競賽營運後,我認為必須在技術上正面應對『如何確保審查的公平性』這個問題。eval000是我們對此問題的解答。eval000 Essential則是讓更多現場能更輕鬆地接觸到這項技術的入口。」

關於eval000

eval000是基於專利權人里吉 竜一先生與株式會社TEN PROXY的共同事業營運合約而營運的元評估AI平台。

專利申請中:特願2026-096693「基於生成AI的評估重構之標準評分計算方法、裝置、程式」(里吉 竜一先生)

服務頁面:https://www.eval000.ai/service

技術探討文章:https://www.eval000.ai/blogs/post/Lv4

專利權人里吉 竜一先生簡介

里吉 竜一先生是專精於標準評分生成原理(Standard Evaluation Generation Principle)的研究者與教育者。他是運用生成式AI進行評估重構演算法的創始人,也是eval000元評估引擎的專利權人。

簡歷與研究成果

現職:東京福祉大學 兼任講師(2024年4月起)負責資訊倫理、資訊安全、多媒體相關科目 前職:縣立高中 資訊與商業教育教師(1992〜2024年,共32年)

學位:經濟學碩士,橫濱市立大學研究所 經濟學研究科(1991年)

所屬學會:日本資訊教育學會/李嘉圖研究會(2000年起)

專利與獲獎

特願2026-096693「基於生成AI的評估重構之標準評分計算方法、裝置、程式」(申請中)

專利第3668491號「自我評估能力測量方法、裝置、程式」— 2005年 獲日本特許廳長官獎勵賞

2024年 公益財團法人全國商業高中協會 功勞獎、群馬縣教育委員會 表彰狀

主要研究與著作

書籍:「Human beings and generative AI」(Amazon,2024年)

審查論文:「資訊倫理教育中的核心課題結構性分析」(資訊教育 6(1),2025年)等8篇

研究課題:「基於生成AI的評估重構之標準評分計算原理研究」(產學合作,2026年)

作品與系統:「生成AI評估重構系統(標準評分計算演算法)」(2026年)

國際學會發表預定(2026年7月)

IOTEIR 2026 — Bridgewater State University(美國麻薩諸塞州)

會議名稱:IOTEIR 2026 First International Conference「Reimagining Education for the Future」

舉辦日期:2026年7月28〜29日(Fully Hybrid)

發表標題:From Evaluation to Standard Generation: A Generative AI-Based Model for Reproducible Educational Assessment

主辦單位:International Organization of Technology Educator & Innovative Researcher(IOTEIR)

公司概要

公司名稱

株式會社TEN PROXY(TEN PROXY,Inc.)

代表人

代表取締役 武道 誠芳

設立

1995年(創業超過30年)

事業內容

元評估AI平台「eval000.ai」營運

競賽管理平台「award-of.net」營運(Award Force日本正規合作夥伴)

IT、行銷、事業開發支援

總部所在地

東京都世田谷區下馬2-11-3-104

URL

https://eval000.ai / https://award-of.net / https://tenproxy.io

本新聞稿相關諮詢

株式會社TEN PROXY(eval000事業部)

[email protected] 平日 10:00〜18:00(日本時間)

電話:03-3413-2267

聯絡人:武道 誠芳

FACT BOX · 重點整理

  • 來源:PR TIMES
  • 分類:サービス開始
  • 相關組織:Award Force