間取り図1枚から、生成AIだけで
3Dウォークスルーはどこまで作れるか
3Dソフト(Blender)を使わず、ChatGPT・Gemini・Claude・Claude Design の4つだけで「3Dモデル」「ウォークスルー」「写実イメージ動画」を作り、Webに公開するまでの記録です。できたことと同じくらい、できなかったことを残しています。
この検証の条件
目的:研修で「生成AIで何ができるか」を言葉ではなく実物で見せる。専門ツールの経験がない人が、AIへの依頼だけでどこまで到達できるかを確かめる。
制約:Blender などの3D制作ソフトは使わない(途中で決定)。動画生成AIも主役にしない。
入力:フリー素材の間取り図1枚と、依頼文。
期間:2026年9月上旬、おおむね4時間。
画面に出ている3Dモデル・画像・動画はすべて生成AIの生成物で、実在の建物や確定した仕様ではありません。天井高・素材・階段の接続などは仮設定です。
制作の流れ
間取り図+依頼文で、まず動画を作らせてみる
同じ図面と依頼文を両方に渡し、ウォークスルー動画を生成。ここで各AIの性格がはっきり分かれた。
ChatGPT:カメラ移動は滑らかで「歩いている」感じが出るが、ポリゴン感が強い。Blender が使えない環境で、自前のレンダラー(C++)を書いて描画していた。
Gemini:画像は自然で綺麗だが、動画がカットのつなぎ合わせで「ブツ切り」。細かい修正指示が効かず、1日に作れる本数にも上限があった。
両方の生成物を、別のAIにレビューさせる
ChatGPT と Gemini が出した動画・GLB(3Dデータ)を Claude に渡してレビュー。「動画は動線を見せる、静止画は写実化の成果を見せる」という役割分担、写実化用のプロンプトシート、階段区間は無理に生成動画でつながず概略モデルの動画をそのまま使う、といった方針がここで固まった。
ChatGPT が書いたレンダラーを Claude が引き継いで改良する場面もあり、「別のAIの成果物を別のAIに渡す」のが普通に成立することが分かった。
3Dモデルとブラウザで動くウォークスルーを作る
GLB と動画を Claude Design に渡し、ブラウザ上で動く3Dモデル(three.js)、約70秒のウォークスルー、自由視点、1階・2階の俯瞰、四季切替を作成。この時点で「Blender は使わない」と決めた。
ポリゴン感はどうしても残った。Blender か動画生成AIを使わない限り、改善には時間がかかると判断し、3Dモデルは「概略で見せるもの」と割り切った。
写実イメージは静止画で別途つくり、動画に仕立てる
3Dモデルの各シーンを参照画像にして、ChatGPT で写実化した静止画8カットを生成(Gemini と Claude では写実化がうまくいかず、ChatGPT を採用)。プロンプトは Claude / Claude Design が作った「共通固定文+カット別追記」のシートを使い、カット間で内装の色や素材が揃うようにした。8枚を Claude Design に取り込み、約64秒のイメージ動画(写真にゆっくりカメラ移動をかける方式)に仕上げた。
公開用パッケージを作らせ、公開作業も AI に任せる
Claude Design に「Webで公開したい」と伝えると、書き出し系の機能を外した公開用フォルダと、次のAIへの引き継ぎ文書(README:そのまま静的公開すること、直すべき箇所、変更してはいけない箇所)が出てきた。それを Claude に渡し、レンタルサーバーへの設置、OG画像の設定、403エラーの原因切り分け、戻り導線の追加、実績一覧への追記まで対話で進めて公開した。
各AIの役割と、向き・不向き
| AI | 担当したこと | 今回分かったこと |
|---|---|---|
| ChatGPT | 初期の3Dモデル化とウォークスルー動画、写実静止画の生成 | 動線のある動画は得意。環境に Blender がなければ自前でレンダラーを書くなど手段を変える。一方で、目的を離れて提案を広げすぎたり、素材の使い方を取り違えて同じ空間を何度も映す構成ミスも起きた。 |
| Gemini | ウォークスルー動画の再生成、質感改善の設計提案 | 画像の自然さは高い。動画は短尺・カット主体で、修正の細かい指示は通りにくい。GLB(3Dデータ)の書き出しはできず、「Blenderで直すならこう」という改善設計の提示にとどまった。 |
| Claude | 生成物のレビュー、方針整理、プロンプトシート作成、公開作業 | 複数AIの成果物を突き合わせて「何をどう使うか」を整理する役に向く。公開作業ではサーバー側の問題の切り分けまで対話で進められた。 |
| Claude Design | 3Dモデル・ウォークスルー・自由視点・動画ページ、公開用パッケージ | 「ブラウザで動くもの」を一式で出せる。次工程のAI向けに引き継ぎ文書まで作るので、人が仕様を書き起こす手間がほぼ要らない。 |
うまくいかなかったこと・人が判断したこと
静止画にズームとフェードをかけただけの動画は、歩いている感覚が出ない。カメラ自体が空間内を移動している動画(視差が連続して変わる)と区別して依頼する必要があった。AI自身に2本を見比べさせると、違いを認めて作り直し方針を出してきた。
比較用に用意した4枚の静止画を、AIが動画本編に順番に並べてしまい、リビングを何度も見直す構成になった。「動画=移動経路を見せる」「静止画=写実化の before / after を見せる」と役割を分けて指示し直した。
1階から階段を上って2階へ続く1本の生成動画は、今の動画生成では崩れやすい。「1階クリップ → 概略モデル動画の階段区間 → 2階クリップ」とカットでつなぐ構成に落ち着いた。
ChatGPT は途中で「建築会社の営業システム導入計画」まで話を広げた。「これは研修で可能性を見せるデモであって、業務システムの提案ではない」と目的を言い直すと、要件を絞った制作計画に戻った。AIは放っておくと仕事を大きくしがちで、範囲を決めるのは人の役目。
写実化は Gemini と Claude では成立せず、ChatGPT に切り替えた。最終的な静止画8カットは、共通固定文を使うことで窓の数・階段・家具配置が参照画像から崩れずに生成できた。崩れたのは動画側で、静止画では大きな崩れは出ていない。それでも生成後は参照画像と並べ、窓の数、壁の開口、階段、家具の向き、天井高、「盛られた」小物がないかを人が確認する工程は残した。
ポリゴン感を消すには Blender か動画生成AIが要る。今回は3Dモデルは概略として許容し、写実イメージは静止画で別に作る、と分けたことで2日に分割はしたが、4時間程度で公開まで到達できた。次は Blender で同じモデルを仕上げ、到達点を並べて比較する予定。
写実化に使った「共通固定文」
カットごとに変えず、毎回プロンプトの冒頭に貼った文です。カット間で「同じ家」に見えるようにするための固定部分で、研修のミニ課題(手元の間取り図+この文で1枚作る)にもそのまま使えます。
Use the attached image as a strict layout reference. Keep EXACTLY the same camera position, lens, room proportions, wall positions, window and door count and placement, staircase position, and furniture layout. Do not add or remove windows, doors, or furniture. Do not change the ceiling height. Render it as a photorealistic architectural interior photograph. Style: Japanese-Scandinavian minimal interior. White painted walls with subtle plaster texture, light oak engineered wood flooring with visible grain, matte white ceiling. Fabric sofa in warm greige, dusty blue accent cushions, walnut-brown wood furniture frames. Soft daylight from the windows, slightly overcast, gentle shadows, no harsh sunlight. Camera: 24mm full-frame, eye level, straight verticals, no fisheye distortion. Clean, uncluttered, real-estate photography quality, 4K.
崩れたときの再指示例:Keep everything as is, but the window on the far wall must be ONE window, not two, matching the reference image exactly. Do not add artwork or additional lights.
成果物
| 3Dモデル & ウォークスルー | three.js(ブラウザ描画)。約70秒の自動ウォークスルー、自由視点、1階・2階俯瞰、四季切替。モデルは約47,000三角形。 |
| 写実イメージ動画 | 写実化した静止画8カットによる約64秒のイメージ動画。 |
| 3Dデータ | ブラウザ上で .glb / .obj に書き出し可能(Blender比較用)。 |
| 公開形態 | ビルド不要の静的ファイル。レンタルサーバーの通常ディレクトリにそのまま設置。 |