來自 6 家廠商的 14 個模型。選一個,看看它的優秀案例、支援的模式和大家的寫法。
OpenAI 的第一代圖像模型。指令跟得緊,畫面裡的文字和版式複雜的圖也能畫準。
Google Gemini 2.5 Flash 世代的圖像模型。出圖快,改圖和保持人物一致特別好用,一般人也玩得起來。
快手可靈(Kling)。圖片方面擅長人像、國風和商品圖,光影與材質表現細膩;提示詞用中文寫就好,給參考圖能鎖住人物和構圖,同一家的影片模型見可靈影片。
2026 年 4 月發布。比上一代生成更快、改圖更準,尺寸靈活、能直接拿一張圖當輸入,畫面裡的文字和版式明顯更好。
字節跳動的 Seedream 系列圖像模型。中文語意理解佳,人像、商品圖與海報都穩定,光影與材質細膩;提示詞用中文寫即可,比例與解析度在介面上選或寫在提示詞裡。
畫味最足的一家,光影、質感和構圖是強項。用風格參考(--sref)和 Omni Reference(--oref)能把風格和角色固定住,參數寫在提示詞末尾。
xAI 的圖像生成(Grok Imagine)。在 X 裡用一句話就能出圖,改圖(換背景、改風格、擴圖)也直接說;風格偏寫實、網感強,適合快速試想法。
2026 年 9 月發布,編輯精度最高的一代,分 Flare(偏快)和 Sunburst(偏精)兩個版本,文字和指令遵循都更穩。
基於 Gemini 3 Pro,會先推理再出圖,還懂世界知識和即時資訊。做海報、資訊圖和視覺化很穩,畫面裡的文字基本不出錯。
Gemini 3.1 Flash 世代,更快的新一代。可上網查資料、製作資訊圖,支援 1K / 2K 與自訂畫面比例。
位元組的 Seedream 5.0 系列。會先推理再出圖,還能聯網查資料,商品圖和海報尤其出色。
快手可靈(Kling)的影片模型。文生影片和圖生影片都行,人物動作和鏡頭運動比較自然,國風、寫實和廣告質感都拿手;提示詞中文寫就好,給首幀圖能鎖住構圖和人物。
字節新一代的音視頻聯合生成模型,一次最長 30 秒、還能續接兩次;能讀懂參考視頻的構圖和鏡頭語言,支持綠幕、白模等專業編輯。
統一的音視訊聯合生成架構,可同時以文字、圖片、音訊、視訊作為參考;運動穩定、音畫同步,用參考素材控制表演、光影和運鏡。