同一張臉、同一個主題,只換一個變因:YouTube 縮圖的四組對照實驗
做 YouTube 縮圖這件事,很容易陷進「再試一次看看」的迴圈:改了提示詞、換了模型、調了品質,出來的圖好像有比較好,但說不出好在哪,也不知道是哪一個改動造成的。
所以這次用對照實驗的方式做:同一個主題、同一張參考人像、同一個平台規格,一次只換一個變因。四組共八張,全部是 API 直接回的成品,沒有經過任何人工修圖。
項目 設定 :--- :--- 主題 如何快速製作 YouTube 影片縮圖 平台 YouTube 1280×720 · 16:9 參考圖 一張人像 策略模型 gpt-5.4-mini(固定不動)
每一組都產 A/B 兩個版本,因為縮圖本來就要做 A/B 測試——如果兩版看起來差不多,那這個策略等於沒有給出選擇。 基準組:讓模型自己寫提示詞
gpt-image-2 · medium · A 27 秒 / B 26 秒
A 版是經典的 YouTube 樣式:大字、大臉、指向的手勢、旁邊配圖示。人像一致,文字也沒寫錯。單看這一張,其實已經可以用了。
問題出在 B 版。人像和文字都沒問題,但畫面偏空——中間那塊玻璃面板裡什麼都沒有,看起來像一個還沒填內容的模板。 意思是:A/B 兩版的差距不是「風格不同」,而是「一個完成了、一個沒有」。這種 A/B 沒有測試價值。 v2:把提示詞改成結構化指令 + 確定性編譯器
gpt-image-2 · medium · A 29 秒 / B 28 秒
不再讓模型自由發揮整段提示詞,改成先產出結構化的版面決策(主體在左還是在右、背景是什麼、要放哪些元素),再用一支確定性的編譯器把它組成最終提示詞。
比基準 A 多了一條「素材 → 縮圖」的流程故事,主體和文字各佔一邊、界線分明,人像維持一致。
B 版終於不空了:人物在做事、金色標題、線稿圖示,電影感暖光的方向成立了。 意思是:B 版會空,不是模型不行,是它沒被要求「這一版要跟 A 版不一樣在哪」。把版面決策從自由發揮改成結構化欄位之後,差異就出得來了。 v2 + 品質開 high:多花 2.5 倍時間,換不到肉眼可見的提升
gpt-image-2 · high · A 73 秒 / B 68 秒
指令完全一樣,只把品質從 medium 調到 high。
元素變多,反而雜了——右側那三張小縮圖在搶焦點。細節確實更銳利,但縮圖在 YouTube 上是被縮到很小看的,銳利度在那個尺寸下看不出差別。
B 版成立,但跟 medium 的 B 屬於同一個水準。 注意:每張從 28 秒變成 70 秒。如果要一次產十幾組候選,這個差距是 5 分鐘和 12 分鐘的差別,而且換不到能被看見的品質。 v2 + chatgpt-image-latest:中文寫錯,人像走樣
chatgpt-image-latest · medium · 1536×1024 裁 16:9 · A 29 秒 / B 24 秒
這個模型不收 1280×720,只能退回 1536×1024 再裁成 16:9。
三張步驟卡上的小字是亂碼——而指令裡明確要求「只渲染標題文字」,它自己加了小字又寫錯。人像也變瘦、五官偏移。
標題把「縮圖」寫成「縮圓」。 人像明顯不是同一個人。 注意:中文字渲染錯誤是縮圖的致命傷——它會直接出現在觀眾眼前,而且是放大的。這一組不是「差一點」,是不能用。 評分表
人眼判定。不用「JSON 格式合格」代替視覺品質——那兩件事沒有關係。
組 人像一致 主題表達 文字正確 A/B 差異 每張秒數 判定 :--- :--- :--- :--- :--- ---: :--- 基準 v1 好 A 好 / B 弱 正確 有 26–27 可用 v2 好 A 好 / B 好 正確 明顯 28–29 採用 v2 high 好 A 雜 / B 好 正確 明顯 68–73 不值得 v2 chatgpt-image-latest 走樣 A 好 / B 普 兩張都錯 明顯 24–29 不採用 結論:v2 策略 + gpt-image-2 medium
v2 的結構化指令加上確定性編譯器,讓 A 版的故事更完整、B 版不再空洞。品質開 high 沒有明顯更好,卻讓每張從 28 秒變成 70 秒。chatgpt-image-latest 的中文字會錯、人像會走樣,不採用。
有一件事值得記下來:v2 在 chatgpt-image-latest 那一組,策略的第一輪被驗證器退回了,理由是 A/B 兩版的 layout 相同——這是設計中的行為,不是失敗。第二輪通過。會做 A/B 的系統,本來就該有一道「這兩版真的不一樣嗎」的檢查。 「一次只換一個變因」聽起來是基本功,但在 AI 生圖這種每次結果都不同的場景裡,它是唯一能讓你說出「好在哪」的方法。