記事サマリー
3D・AI画像生成を手がけるクリエイター「Catapp-Art3D」氏によるnote記事(有料メンバーシップ記事の前半部分は無料公開)。AI画像編集には一定確率で必ず失敗が発生し、モデルの進化でも改善見込みが薄い――その前提のもと、「ローカルAI環境+人間の手作業」を組み合わせれば静止画ならほぼ何でも作れるという実践的な修正ワークフローを解説している。
Z-Image-Turbo
Qwen-Image-Edit 2511
Flux.1 Kontext
Qwen3 VL
LanPaint (ComfyUI)
SeedVR2
NMKD-Superscale
ollama + OpenWebUI
著者の核心的な主張: 失敗の根は深く、学習量・規模を増やしても大きく改善する見込みはない。コーディングのように「検算」できる分野はイテレーションで精度を上げられるが、画像編集はそうではない。ゆえに「人間の補助でほぼ100%何でも可能にする」手法が実用上の答えになる。
1. 問題設定: AI画像編集の「必ず失敗する」性質
- ハルシネーション等(明確な技術的因果のない失敗)は、規模・クラウド/ローカル・モデル種を問わず一定確率で発生。
- 上手くいく時は全く修正不要、ダメな時は何をやってもダメ → 人間によるバグ修正が必要。
- この性質はモデル発展でも改善しない、というのが著者の判断。
2. 事例の流れ: キャラの背景変更とその連鎖修正
- 背景変更: Z-Image-Turboで生成したキャラの背景をQwen-Image-Edit 2511で変更。光の反射まで考慮した優秀な合成だが、イラスト風が強調され「のっぺり」になる(SF/ファンタジー要素で顕著。プロンプト制御には限界)。
- 写実化リファイン: 事前にVLM(Qwen3 VL)でプロンプトを生成 → 写実表現が得意なZ-Image-Turboで30%のimg2imgリファイン。のっぺり感が解消され写実的に。
- 新たな問題「アイデンティティ消失」: img2imgの副作用で剣のデザインや衣装が変わってしまう。
- 剣のデザイン復元: 元に戻す用途には最新のQwen-Image-Edit 2511より旧版2509やFlux.1 Kontextの方が参照元に忠実で得意。赤塗り+参照画像で置換し、レイヤー・グラデーション消しゴムで編集モデルによる劣化を最小化。
- 衣装の復元: 通常のEditモデルでは「指示にない箇所を変更」「ただ失敗」が起こる(理由のない「苦手」はAIに良くある)。そこでLanPaint(ComfyUI必須)を利用。Editモデルを反復試行して速度を犠牲に高精度なインペイントを実現。
- 最終手段は「困った時の3DCG」: 非常に面倒だがすべてを可能にする。
- 仕上げのアップスケール: 継ぎはぎを目立たなくするため、SeedVR2+NMKD-Superscaleで全体をAI高画質化(4K)し「均す」。
3. 技術的ポイントの整理
- モデルの使い分け: 背景の自然な再合成には最新Editモデル、参照元への忠実な復元には旧版(2509)やFlux.1 Kontext、写実化にはZ-Image-Turboのimg2img、高精度インペイントにはLanPaint、と「得意分野」でモデルを使い分けるのが本質。
- 劣化最小化の工夫: 編集箇所を赤で塗って置換 → レイヤー合成とグラデーション消しゴムで元画像を活かす。編集モデルを通す面積を最小化する戦略。
- VLM×画像生成のパイプライン: ollama + OpenWebUI上のQwen3 VLでimg2img用プロンプトを自動生成(メタ・プロンプトは記事付録に用意されている)。
- 反復で精度を買う: LanPaintはEditモデルを何度も試行することで、速度を犠牲に複雑なインペイントの精度を引き出す。
4. まとめ: 著者の結論
- ローカルの画像編集・修正環境+面倒な人間作業があれば、静止画に限り「人の脳内で画像化できるものは全て表現可能」な時代になっている。
- 「できる/できない」で言えば、(公開可否は別として)既に不可能な表現はない。
- この性質は性能と無関係に成立するものであり、クラウドAIでは不可能なこと(自由なワークフロー構築と手作業の混在)だ、という指摘が特徴的。
※ 後半(メタ・プロンプトの全文など)は月額1,000円のメンバーシップ限定公開。冒頭〜ワークフロー解説・完成図までは無料で読める。
コメント(レポート作成者より)
「AIの失敗は根深く、モデル進化では解決しない」という前提を置いた上で、失敗を人間の手で確実にリカバリする実ワークフローを示すのが本記事の価値。モデルの得意・不得手の使い分け(最新=大胆な再合成、旧版=忠実な復元)や「編集モデルに通す面積を最小化する」といったレタッチ的な発想は、画像生成AIを実用する上で直接応用できる知見。クリエイター向けの実践記事として読み応えあり。