株式會社TEN PROXY(總部:東京都,代表取締役:武道 誠芳)宣布啟動元評估AI平台「eval000(エバル・トリプルゼロ)」事業,並作為第一彈推出評估外包服務「eval000 Essential」。
評估AI現況:Lv3瓶頸
生成式AI的評估自動化在過去一兩年內迅速進入實裝階段。在商業計畫、人事評估及企業審查等領域,利用LLM進行評分與回饋生成的導入案例日益增加。
然而,若將自動駕駛的SAE等級分類映射到評估AI上,會發現現今許多系統僅止於「Lv3」。
▲ Lv3的結構性問題:道德擠壓區(Moral Crumple Zone)
儘管評分已自動化,但仍需由人類持續判斷「是否能信賴該結果」。
即使使用評估AI,判斷的責任仍歸屬於人類。研究者Madeleine Elish將此結構稱為「道德擠壓區(責任緩衝墊化的人類)」。
eval000以元評估引擎應對此問題。
eval000的Lv4設計—分三層自動化
eval000的元評估引擎將評估分解為三個層級。Layer 01至02無需人類介入即可完成的設計,是達到Lv4的根據。
Layer
角色
處理
內容
負責區分
Lv3(參考)
評分自動化
評分+建議判斷
人類持續判斷結果的可信度
等待後援
Layer 01
感測器輸入
一次評估
由AI Persona評審員進行評分
AI Persona評審員
自動化
Layer 02
駕駛行為
收斂處理
由元評估引擎計算標準評分
元評估引擎
自動化
Layer 03
目的地設定
原理設定
最終判斷
設定與最終決定評估目的與方針
人類(恆常性)
恆常性
人類
「無論自動駕駛汽車多麼自主,目的地仍由乘客指定。駕駛行為的自動化與目的地設定的自動化是完全不同的問題。」
— 摘自eval000.ai 技術探討文章「評估的自動駕駛,現今何合目—從審查AI與eval000看HITL的真正意義」
此設計意味著從Human-in-the-Loop(AI的即時核准)轉向Human-in-Command(專注於原理設定與最終判斷的人類)。
「eval000 Essential」概要與特點
元評估AI平台
eval000 Essential保留了eval000元評估引擎的核心技術,並以評估外包服務的形式提供,無需年約或專業知識。我們以更簡潔、更快速、更易於使用的形式,將元評估的價值傳遞給各種評估現場,如競賽評審、補助金審查、人才招募評估等。
主要特點
Persona評審員的多角度評估:具有不同評估傾向的AI Persona評審員,如重視創新者、重視實績者、重視平衡者、重視協調者等,進行平行評估。透過固定點收斂,達成相同的標準評分。
基於評分標準的個別回饋:根據評分標準(Rubric)生成高度個人化的回饋意見。
評估方針的初步明確化(Layer 03):在開始前將審查目的與方針明確化為「外生原理」。Essential在商業競賽領域的標準(預設)方針為「評估在四年內有潛力達到種子輪至A輪階段的早期事業可行性」。
簡易啟動與明確的收費標準:NDA可透過電子簽名最快當日完成。免費報價。商業競賽領域免設定費,採用階段性單價(¥1,800〜¥5,000/件)的易於使用的價格設計。
主要應用場景
商業競賽、加速器計畫的審查
企業內部新事業審查、內部創業制度
補助金、獎勵金的核准審查
人才招募評估、內部表彰制度
與award-of聯動
本公司營運的「award-of(award-of.net)」是Award Force在日本的正規合作夥伴,Award Force是源自澳洲、導入於50多個國家、全球領先的獎項管理SaaS。透過整合eval000與award-of,實現報名管理、標準評分計算、回饋自動發送的一站式審查DX。
評估的結構性課題
偏見:因審查員的專業領域與經驗不同,評估標準差異大,即使是相同的提案也可能導致評分分歧。
雜訊:即使是同一審查員,也會因審查時機與順序不同而導致分數波動。根據Kahneman等人的研究,平均變動幅度為19%。
AI的個性:即使使用生成式AI進行評估,不同模型也會有其評估上的「個性」。本公司PoC在同一提案上,不同模型之間曾出現最高12分(滿分100分)的差異。
誤差:評分標準(Rubric)的設計需要專業性,容易流於個人化或形式化。
代表取締役 武道 誠芳 評論
「透過award-of事業參與了眾多競賽營運後,我認為必須在技術上正面應對『如何確保審查的公平性』這個問題。eval000是我們對此問題的解答。eval000 Essential則是讓更多現場能更輕鬆地接觸到這項技術的入口。」
關於eval000
eval000是基於專利權人里吉 竜一先生與株式會社TEN PROXY的共同事業營運合約而營運的元評估AI平台。
專利申請中:特願2026-096693「基於生成AI的評估重構之標準評分計算方法、裝置、程式」(里吉 竜一先生)
服務頁面:https://www.eval000.ai/service
技術探討文章:https://www.eval000.ai/blogs/post/Lv4
專利權人里吉 竜一先生簡介
里吉 竜一先生是專精於標準評分生成原理(Standard Evaluation Generation Principle)的研究者與教育者。他是運用生成式AI進行評估重構演算法的創始人,也是eval000元評估引擎的專利權人。
簡歷與研究成果
現職:東京福祉大學 兼任講師(2024年4月起)負責資訊倫理、資訊安全、多媒體相關科目 前職:縣立高中 資訊與商業教育教師(1992〜2024年,共32年)
學位:經濟學碩士,橫濱市立大學研究所 經濟學研究科(1991年)
所屬學會:日本資訊教育學會/李嘉圖研究會(2000年起)
專利與獲獎
特願2026-096693「基於生成AI的評估重構之標準評分計算方法、裝置、程式」(申請中)
專利第3668491號「自我評估能力測量方法、裝置、程式」— 2005年 獲日本特許廳長官獎勵賞
2024年 公益財團法人全國商業高中協會 功勞獎、群馬縣教育委員會 表彰狀
主要研究與著作
書籍:「Human beings and generative AI」(Amazon,2024年)
審查論文:「資訊倫理教育中的核心課題結構性分析」(資訊教育 6(1),2025年)等8篇
研究課題:「基於生成AI的評估重構之標準評分計算原理研究」(產學合作,2026年)
作品與系統:「生成AI評估重構系統(標準評分計算演算法)」(2026年)
國際學會發表預定(2026年7月)
IOTEIR 2026 — Bridgewater State University(美國麻薩諸塞州)
會議名稱:IOTEIR 2026 First International Conference「Reimagining Education for the Future」
舉辦日期:2026年7月28〜29日(Fully Hybrid)
發表標題:From Evaluation to Standard Generation: A Generative AI-Based Model for Reproducible Educational Assessment
主辦單位:International Organization of Technology Educator & Innovative Researcher(IOTEIR)
公司概要
公司名稱
株式會社TEN PROXY(TEN PROXY,Inc.)
代表人
代表取締役 武道 誠芳
設立
1995年(創業超過30年)
事業內容
元評估AI平台「eval000.ai」營運
競賽管理平台「award-of.net」營運(Award Force日本正規合作夥伴)
IT、行銷、事業開發支援
總部所在地
東京都世田谷區下馬2-11-3-104
URL
https://eval000.ai / https://award-of.net / https://tenproxy.io
本新聞稿相關諮詢
株式會社TEN PROXY(eval000事業部)
[email protected] 平日 10:00〜18:00(日本時間)
電話:03-3413-2267
聯絡人:武道 誠芳
FACT BOX · 重點整理
- 來源:PR TIMES
- 分類:サービス開始
- 相關組織:Award Force