来自 6 家厂商的 14 个模型。选一个,看看它的优秀案例、支持的模式和大家的写法。
OpenAI 的第一代图像模型。指令跟得紧,画面里的文字和版式复杂的图也能画准。
谷歌 Gemini 2.5 Flash 那一代的图像模型。出图快,改图和把人物保持一致特别好用,普通人也能玩起来。
快手可灵(Kling)。图片侧擅长人像、国风和商品图,光影与材质表现细腻;提示词中文写就好,给参考图能锁住人物和构图,同一家的视频模型见可灵视频。
2026 年 4 月发布。比上一代生成更快、改图更准,尺寸灵活、能直接拿一张图当输入,画面里的文字和版式明显更好。
字节跳动的 Seedream 系列图像模型。中文语义理解好,人像、商品图和海报都稳,光影和材质细腻;提示词用中文写就行,比例和分辨率在界面上选或写在提示词里。
画味最足的一家,光影、质感和构图是强项。用风格参考(--sref)和 Omni Reference(--oref)能把风格和角色固定住,参数写在提示词末尾。
xAI 的图像生成(Grok Imagine)。在 X 里用一句话就能出图,改图(换背景、改风格、扩图)也直接说;风格偏写实、网感强,适合快速试想法。
2026 年 9 月发布,编辑精度最高的一代,分 Flare(偏快)和 Sunburst(偏精)两个版本,文字和指令遵循都更稳。
基于 Gemini 3 Pro,会先推理再出图,还懂世界知识和实时信息。做海报、信息图和可视化很稳,画面里的文字基本不出错。
Gemini 3.1 Flash 那一代,速度快的下一代。会上网查资料、做信息图,支持 1K / 2K 和自定义画面比例。
字节的 Seedream 5.0 系列。会先推理再出图,还能联网查资料,商品图和海报尤其出色。
快手可灵(Kling)的视频模型。文生视频和图生视频都行,人物动作和镜头运动比较自然,国风、写实和广告质感都拿手;提示词中文写就好,给首帧图能锁住构图和人物。
字节新一代的音视频联合生成模型,一次最长 30 秒、还能续接两次;能读懂参考视频的构图和镜头语言,支持绿幕、白模等专业编辑。
统一的音视频联合生成架构,可以同时拿文字、图片、音频、视频当参考;运动稳定、音画同步,用参考素材控制表演、光影和运镜。