AI動画生成の原理:拡散モデル、CLIP、および条件付け技術の解説

1 件の動画 · 更新: 2時間前
But how do AI images and videos actually work? | Guest video by Welch Labs 📺 But how do AI images and videos actually work? | Guest video by Welch Labs ⏱ 37:20📅 2025/09/27 06:24🌐 日本語翻訳

AI動画生成の原理:拡散モデル、CLIP、および条件付け技術の解説

▼

テキストプロンプトから高品質な画像や動画を生成するAIモデルの背後にある物理的・数学的原理を解説します。拡散プロセスとブラウン運動の関係、CLIPによるテキストと画像の埋め込み空間、そしてDDPMやDDIMといった生成アルゴリズムの仕組みを、直感的な例を用いて詳しく分析します。

■ 拡散モデルの基礎と物理的アナロジー
- 拡散プロセスとブラウン運動の関連性
- 純粋なノイズからリアルな動画への段階的変換プロセス
- WAN 2.1などのオープンソースモデルにおける実装概要

■ CLIPと共同埋め込み空間
- OpenAIのCLIPモデルによるテキストと画像のベクトル表現
- テキストと画像の類似度を測るコサイン類似度の概念
- 埋め込み空間での幾何学的操作(帽子の有無など)

■ DDPMと拡散プロセスの逆転
- ノイズを追加し、それを除去するように学習させる手法
- 予測されたノイズと元のデータ間の関係
- 生成時のランダムノイズ追加が画質向上に与える影響

■ DDIMとフローマッチング
- 確率的微分方程式から常微分方程式への変換
- ノイズなしでの高速かつ決定論的な画像生成
- WANモデルで使用されるフローマッチングのアプローチ

■ テキスト条件付けとClassifier-Free Guidance
- CLIP埋め込みベクトルを用いた生成制御
- 条件付きモデルと非条件付きモデルの差を利用したガイダンス
- ネガティブプロンプトとガイドスケールパラメータの効果

この動画を紹介した 3Blue1Brown の最新動画も、紹介付きで読めます。

📄 このページの紹介文は AI が独自に生成したものであり、著作権をはじめとする他者の権利(商標権・名誉権・プライバシー等)を侵害しないよう配慮しています。動画の著作権は各作成者に帰属します。