6 社の 14 モデル。ひとつ選んで、優れた作品、対応モード、みんなの書き方を見てみましょう。
OpenAIの第一世代画像モデル。指示に忠実で、画像内の文字や複雑なレイアウトも正確に描ける。
Google Gemini 2.5 Flash世代の画像モデル。生成が速く、画像編集や人物の一貫性維持が得意で、一般の人でも気軽に使える。
Kling(可霊)。画像生成は人物・中国風・商品画像が得意で、光と質感の表現が繊細。プロンプトは中国語でOK、参考画像で人物と構図を固定できる。同社の動画モデルはKling Videoを参照。
2026年4月リリース。前世代より生成が速く、編集が正確。サイズ自由、画像をそのまま入力可。文字とレイアウトが大幅向上。
ByteDanceのSeedreamシリーズ画像モデル。中国語の意味理解に優れ、人物・商品画像・ポスターも安定。光と質感が繊細。プロンプトは中国語でOK。比率と解像度はUIで選択かプロンプトに記載。
画味が最も強い一家。光・質感・構図が強み。スタイル参照(--sref)とOmni Reference(--oref)でスタイルとキャラを固定でき、パラメータはプロンプト末尾に記載。
xAIの画像生成(Grok Imagine)。Xで一言入力するだけで画像が作れ、背景変更・スタイル変更・拡張などの編集も指示するだけ。写実的でトレンド感のあるスタイルが特徴で、アイデアを素早く試すのに向いています。
2026年9月リリース、編集精度が最も高い世代。Flare(速め)とSunburst(精密)の2バージョンがあり、テキストと指示への追従がより安定。
Gemini 3 Pro搭載。推論してから画像を生成し、世界知識とリアルタイム情報も理解。ポスター・インフォグラフィック・可視化に強く、画像内の文字もほぼ正確。
Gemini 3.1 Flash世代の、高速な次世代モデル。ウェブ検索やインフォグラフィック作成に対応し、1K / 2Kやカスタムアスペクト比をサポート。
ByteDanceのSeedream 5.0シリーズ。推論してから画像を生成し、ネット検索も可能。商品画像やポスターが特に優秀。
快手可霊(Kling)の動画モデル。テキスト・画像からの動画生成に対応し、人物の動きやカメラワークが自然。中国風・写実・広告風が得意。プロンプトは中国語でOK、最初のフレーム画像で構図と人物を固定できる。
バイトダンスの新世代音声・映像同時生成モデル。1回最長30秒、さらに2回まで継続可能。参考動画の構図やカメラ言語を理解し、グリーンバックや白モデルなどのプロ編集に対応。
統合的な音声・映像同時生成アーキテクチャ。テキスト、画像、音声、動画を同時に参照可能。動きが安定し、音画が同期。参照素材で演技、光影、カメラワークを制御。