・在總計112項評估中,MyMarketer辯論模式於97項(86.6%)中表現優越,14項評估結果相當,僅1項處於劣勢。
・比較對象涵蓋四個產業:AI行銷SaaS、在地型美容院、網頁設計公司、專精繼承稅務的會計師事務所。
・策略產出來源經過匿名化處理,並交換提示順序,由GPT、Claude與Gemini三種模型從14個面向進行評估。
・本次驗證並非用以衡量特定AI模型的整體性能,而是包含部分輸入條件差異的內部基準測試。詳細比較條件載於本文中。
WHAT股份有限公司(總部:東京都新宿區西新宿3-3-13 西新宿水間大樓6樓,代表取締役:山本至人)於2026年7月11日針對其行銷策略支援AI「MyMarketer」所搭載的「辯論模式」,以四個產業的合成情境為對象,實施了內部比較基準測試。
本次驗證比較了MyMarketer的「辯論模式」——由具備不同角色的多個AI行銷專家進行討論以整理策略——與Claude Fable 5及GPT-5.6 Sol所產生的單次策略產出。目的不在於評估特定AI模型的整體能力,而是探討多AI辯論型策略設計與單次生成在產出評價上的差異。
驗證結果概要
本次驗證使用以下四個產業的合成問答情境:
AI行銷SaaS/在地型美容院/網頁設計公司/專精繼承稅務的會計師事務所
針對各產業,由MyMarketer辯論模式與比較對象模型所生成的策略,從14個面向進行評估。
整體結果
在總計112項評估中,MyMarketer辯論模式於97項中被評為優越。
然而,並非所有面向皆由辯論模式勝出。亦有單次生成策略更優或評價相當的情況。
與Claude Fable 5的比較:56項評估中48項佔優
將MyMarketer辯論模式與Claude Fable 5的單次策略生成於四個產業中進行比較。
在在地型美容院、網頁設計公司、專精繼承稅務的會計師事務所等三個產業中,辯論模式皆未出現劣勢評定。
然而,在AI行銷SaaS情境中,Claude Fable 5側使用的是2026年7月6日的產出,而MyMarketer辯論模式側則於7月11日使用包含自研調查資料的輸入進行生成。
由於雙方輸入條件不一致,AI行銷SaaS情境的結果不視為嚴格的同條件比較,僅作為探索性參考值。
其餘三個產業則統一了輸入條件進行比較。
與GPT-5.6 Sol的比較:56項評估中49項佔優
作為追加驗證,亦將MyMarketer辯論模式與GPT-5.6 Sol的單次策略生成進行比較。
GPT-5.6 Sol使用最大推理設定,於四個產業中原則上輸入與MyMarketer辯論模式相同的營運資訊,並使用當日的相同快照資料。
與GPT-5.6 Sol的比較中,四個產業皆未出現辯論模式劣後的評定。
然而,AI行銷SaaS情境的評定一致率為83%,相較其他產業,評估模型間的判斷差異較大。
評定一致率的計算方式已公開於基準測試詳情頁面。
唯一劣後的評定項目為「獨特性」
本次驗證中,單次生成策略唯一佔優的評定,是Claude Fable 5在AI行銷SaaS情境中的「獨特性」項目。
但由於前述輸入條件差異,此結果的解讀需謹慎。
此外,雖有單次生成在獨特性上獲評較高,但僅憑單次運行難以判斷此差異源於辯論機制本身,或生成式AI的機率性波動。
在「潮流、Why Now」等部分面向,亦觀察到評定相當的情況。
本次結果並非表示多AI辯論在所有產業與評估面向皆優於單次生成。
未來將進行多次生成與評估,以驗證辯論機制更有效的領域,以及單次或發散式生成更適宜的領域。
背景:提案現場無法直接使用AI產出
運用生成式AI快速產出行銷策略或提案書雛型的機會日益普及。
然而,單次AI產出即使提供多項行動方案,仍常未能充分整理以下關鍵點:
・哪些課題被視為最重要
・優先目標客群為何
・於何市場或領域與競爭對手差異化
・策略如何連結至具體行動
・提案內容是否具備可行性與經濟合理性
特別是負責向客戶提出新方案或改善既有服務的網頁設計公司與行銷支援公司,僅直接呈現AI生成文字並不充分。
提案者必須理解內容,以自身語言說明,並做出最終判斷。
MyMarketer的辯論模式,是由具備不同角色的多個AI行銷專家進行討論,以結構化行銷策略論點與結論的功能。
本次驗證比較了單一AI的單次生成與多AI辯論型策略設計,探討其產出評價的差異。
降低產出來源與提示順序影響的匿名比較評估
為盡可能降低產出來源名稱與提示順序對評估的影響,本次驗證採用以下方法:
1.原則上輸入相同的營運資訊
MyMarketer辯論模式與比較對象模型原則上輸入相同的營運資訊。
對比較對象模型不進行多輪討論或額外互動,僅要求以文字形式進行單次策略生成。此外,單次生成側的Claude Fable 5與GPT-5.6 Sol未使用工具或網路搜尋功能。但Claude Fable 5的AI行銷SaaS情境條件除外。
Claude Fable 5側重用2026年7月6日的產出,MyMarketer辯論模式側則於7月11日使用包含自研調查資訊的輸入進行生成。其餘三個產業則統一輸入條件。
2.產出來源匿名化
對評估模型不揭露各策略的服務名稱或模型名稱,僅以「策略A」「策略B」呈現。
目的在於降低品牌名稱或產出來源的先入為主觀對評估造成的影響。
3.AB/BA雙條件比較
為確認提示順序的影響,於以下兩種條件下進行評估:
策略A優先,
FACT BOX · 重點整理
- 來源:PR TIMES
- 分類:調查
- 原文日期:2026年7月11日 / 2026年7月6日
- 產品、服務:MyMarketer