企業導入 ChatGPT Images 2.5 要先做風險分流
ChatGPT Images 2.5 一次推出 gpt-image-2.5-sunburst 和 gpt-image-2.5-flare,表面上是多一個 model choice,實際上比較像在提醒 enterprise PM:圖片 workflow 也需要 routing policy。OpenAI 表示累計生成量已超過 30 億張,這個規模代表大家很快會把它從 demo 拉進 production。
我最在意的不是浣熊能不能乖乖出現在研究圖表旁邊,而是圖片經過第三輪修改後,還是不是同一隻浣熊、同一份圖表、同一個品牌。上週在 review 一個 marketing asset pipeline,團隊原本把所有請求都丟給同一個模型。結果第一輪很漂亮,第二輪改文字時 logo 變形,第三輪只要求換背景,人物臉和產品比例也一起漂掉。設計師說可以人工修,但每張多花 18 分鐘,算下來每月 2,000 張就是 600 小時,ROI 直接被吃掉。
我的 take 是先按任務風險分三層。低風險的 social crop、內部簡報插圖、沒有 reference 的日常生成,可以走 Flare,優先看 latency 和單張成本。中風險的 campaign variant、產品情境圖,要保留品牌色、版型和人物設定,先用 Flare 做 4 個草稿,再送 Sunburst 做 final edit。高風險的 regulated industry 素材、客戶 logo、醫療或金融資訊,直接限制 Sunburst,並要求 human approval,不能讓模型自己 publish。
驗收不要只問「看起來像不像」。我會在 rollout 前做一份 20 組測試集,每組放原始 reference image,加上 3 輪固定 edit prompt。每輪記四個分數:主體保留、文字正確、版面遵循、品牌合規,各 0 到 5 分。我的 gate 會設成主體保留平均至少 4.5,文字正確 4.8,且 20 組中不能有任何一組出現錯 logo、錯價格或個資外洩。只看第一輪通過率沒有意義,真正的 failure 通常在第二輪以後才出現。
成本也要跟 ownership 綁在一起。假設 Flare 每張平均 0.04 美元,Sunburst 是 0.16 美元,2,000 張全走 Sunburst 是 320 美元,分流成 75% Flare、25% Sunburst 則是 120 美元,省下 200 美元只是表面。更重要的是把 reviewer、重跑和 incident handling 算進去。誰維護 reference image?誰批准高風險素材?誰在模型更新後重跑 regression set?沒有 owner,便宜的 API 也會變成昂貴的 compliance ticket。
建議 pilot 先跑兩週、限定 3 個 use case,每個 use case 至少留 50 次 request 的 latency、retry、人工修改時間和拒絕原因。兩週後不要只看平均分,要看 worst 10% 和多輪 edit 的 drift。模型變快很有價值,但 enterprise 真正買單的是可預期的結果。圖片能生成只是起點,能不能在第 3 輪仍然 aligned,才是 production readiness。
作者:Vivian L