調查概述 Combeez Inc. 針對 Google 的「Gemini 3.5 Flash」與 OpenAI 的「GPT-5.5 Instant」兩大主要生成式 AI 模型,進行了圖像生成與角色還原度的對比研究。

本項調查使用了公司原創吉祥物「Combee-chan」的圖像作為素材,分別透過「簡單提示詞」與「複雜提示詞」兩種模式,分析了各 AI 的輸出結果及各自擅長與不擅長的特徵。

調查 1:大方向指令下的比較 針對提示詞:「請生成一張所附角色在城市中飛翔的插圖。」 兩款 AI 皆能準確理解大方向指令,並順利生成角色在城市中飛翔的插圖。在簡單且賦予 AI 自行思考空間的圖像生成任務中,兩者均展現了高度的實用性。

調查 2:複雜指令下的比較 我們使用針對情境、筆觸與構圖進行細緻規範的高難度提示詞進行調查。在詳細指令的要求下,兩者的特徵與實力差距變得相當明顯。

在綜合品質與角色還原度方面,GPT 表現出較高的性能。Gemini 對於將複雜指示完整反映在插圖中稍顯吃力(例如:角色產生了不該出現的手腳等情況)。

此外,兩者在畫風與質感偏好上也各具特色。Gemini 傾向於輸出線條清晰、風格溫暖如繪本般的插圖;而 GPT 則在真實質感表現上更為出色,能夠細膩地再現水彩畫的特徵。

總評 現階段來看,GPT 在細節還原與複雜構圖要求方面具有更強的實力。然而,AI 技術正日新月異地進化,未來的功能提升值得期待。

調查概要 - 對象:主要生成式 AI (Gemini 3.5 Flash / GPT-5.5 Instant) - 期間:2026 年 4 月 17 日至 2026 年 5 月 16 日 - 目的:調查提示詞複雜度對輸出結果及 AI 特徵的影響。

FACT BOX · 重點整理

  • 來源:PR TIMES
  • 分類:調查
  • 相關組織:Google / OpenAI
  • 產品、服務:Gemini 3.5 Flash / GPT-5.5 Instant