海外動画の内容を AI が日本語に翻訳・要約。登録不要で読める動画要約・翻訳ページ
📺 Celebrating one billion Gemma downloads
Gemma 10億ダウンロード記念イベント:開発者たちが語るモデルの現在地と未来
▼
Gemma 1 Billion Downloadsイベントで、Gemmaモデルを活用する開発者たちが、その特長や実際の使い方、今後の展望について語るインタビュー映像です。モデルの性能評価から新機能、関連ツールやプラットフォームの話題まで、開発者視点でGemmaの現在地を伝えます。
■ 開発者たちが語るGemmaの特長
- ビジョン分野での性能と、モデルサイズに対する世界知識の高さ
- 最新モデルの高速動作と、初期状態での扱いやすさ
- Gemma 4の動画・音声理解への対応
■ エコシステムと今後の展開
- クリエイティブライティング向けのポストトレーニングや対話型ストーリーの試み
- Unsloth Desktopのローカル動作するコーディングエージェント
- GenieXプラットフォームでの需要とGemma 5、6への期待
Gemmaモデルの現状と今後の方向性に関心がある開発者やAI活用を検討する人にとって、実際の開発者の声を通じて最新の動向を把握できる内容です。
📺 Agentic video understanding in Gemini
Geminiによるエージェント型動画理解の仕組み
▼
動画全体をモデルに渡すのではなく、ツールを介して必要な情報だけを取得するエージェント型の動画理解の仕組みを解説します。従来のフレーム分割方式の課題と、コスト削減と精度向上を両立するアプローチを紹介します。
■ 従来の動画処理の課題
- 全フレームを渡すとトークン数が膨大になる
- 必要な箇所だけに注目するのが難しい
■ エージェント型動画理解の仕組み
- 動画への参照とツールをモデルに提供
- トランスクリプト取得、フレーム取得、音声取得などのツールを選択
- 思考・行動・観察のループで必要な情報を絞り込む
■ 効果と利点
- トークン数を削減しコストを低減
- クエリに関連する部分に集中できるため性能が向上
動画処理の効率化に関心がある開発者や、Geminiの機能を活用したい方に向けて、エージェント型アプローチの基本概念を学べます。実際のツール利用の流れを理解し、自身の動画解析に応用する手がかりを得られます。
📺 Koray Kavukcuoglu on frontier models, coding agents, and building AGI
Google DeepMindのコライ・カブクチュオール氏が語る、Geminiの進化とAGIへの道のり
▼
Google DeepMindのコライ・カブクチュオール氏が、Gemini 3.5シリーズの急速な進化やGemini 4への取り組み、AGI開発における考え方について語る対談です。モデルからエージェントへの移行や、研究と製品開発の並行した進め方など、開発現場の視点から率直に話しています。
■ Geminiの進化とエージェント化
- 3.5から3.7への短期間での進化と、ソフトウェアエンジニアリング領域での学び
- モデルからエージェントへの移行と、ユーザーとの共創の重要性
■ フロンティアへの姿勢とGoogleの強み
- フロンティアに立つことへの明確なこだわり
- Googleの長期的な技術投資と、製品を通じたフィードバックの価値
■ AGIの定義と進歩の捉え方
- AGIを測る明確なテストは存在せず、進歩の積み重ねが重要
- 過去のAI研究の目標と現在の汎用知能への流れ
■ DeepMind初期の歴史と現在の研究開発
- 最初のディープラーニング研究者としての経験と、AtariやDQNへの取り組み
- 基礎的な学習手法は変わらず、扱う領域の複雑さが増大
AI開発の最前線やAGI実現に向けた考え方に関心がある視聴者にとって、開発を率いる立場からの具体的な視点を得られる内容です。
📺 How to build with Gemini 3.5 Transcribe
Geminiベースの文字起こしモデル「Gemini 3.5 Transcribe」の紹介とデモ
▼
Geminiを活用した新しい文字起こしモデル「Gemini 3.5 Transcribe」を発表します。Interactions APIとLive APIの両方で利用でき、従来のモデルが苦手とする英数字やメールアドレス、電話番号などの認識精度を高めます。
■ 主な機能と設定
- カスタム語彙の指定による固有名詞の認識向上
- 言語ヒントの設定による文字起こし精度の向上
- 70以上の言語の自動認識と多言語対応
■ デモで示された活用例
- メールアドレスや電話番号の正確な文字起こし
- 単位や数値表現の適切な変換(100 cm → 1 m など)
- 英語とドイツ語の混在や言語間の数値表現の違いへの対応
リアルタイム文字起こしや高精度な文字起こしを必要とするアプリケーション開発者に向けて、具体的な設定方法とデモを通じて活用イメージを提供します。Interactions APIとLive APIで試用できます。
📺 Build a live translation broadcast app with the Gemini Live API and LiveKit
Gemini 3.5 Live翻訳モデルを活用したライブ翻訳ブロードキャストデモの解説
▼
本動画では、Gemini APIで新しく利用可能になったGemini 3.5 Live翻訳モデルを使い、ライブ音声を多言語へ同時翻訳して配信するデモアプリケーションを紹介します。LiveKitとGoogle Cloud Runを組み合わせた実装方法や、翻訳セッションの管理、デプロイ手順までを解説します。
■ デモの概要と動作の仕組み
- イベントIDを利用したLiveKitルームへの音声配信
- 視聴者が選択した言語ごとにGemini Live翻訳セッションを起動
- 同じ言語の視聴者は既存セッションを共有し、リソースを効率化
■ アプリケーションの構成と実装
- Next.jsとLiveKitを使用した構成
- Gemini Live APIへのWebSocket接続と音声・字幕データの配信
- 翻訳ブリッジのセッション管理の仕組み
■ Google Cloud Runへのデプロイ方法
- DockerfileとSecret Managerを利用したセットアップ
- デプロイコマンドと認証設定
- スケーリングの制約と対応方針(最大インスタンス数、同時言語数の上限など)
■ 対象者と得られる知識
- Gemini APIやLiveKitを活用したリアルタイム翻訳システムの構築方法を学びたい開発者向けです。デモのソースコードは公開されており、実際のイベントでの利用例や、スケール時の設計判断についても知ることができます。
📺 Hands on with Gemini 3.7 Flash
Gemini Flash 3.7で実現するエンタープライズAIの効率化とコスト最適化
▼
エンタープライズ向けAI活用の現場では、大量の文書処理や日々の意思決定を支えるモデルに、精度だけでなく効率性とコスト競争力が求められています。本内容では、Gemini Flash 3.7がもたらすトークンコストの削減や低レイテンシーを活かしたモデル選択の考え方、マルチエージェントシステムにおける活用方法が具体例とともに紹介されます。
■ エンタープライズAIの課題とGemini Flash 3.7の役割
- 保険や金融などでの大量文書処理とスケール要件
- 1日100万件の意思決定をデータに基づいて行う必要性
■ コストと精度を両立するモデル選択
- 「最小 viable モデル」の考え方と過剰投資の回避
- 3.6から3.7へのトークンコスト削減とレイテンシー改善
■ マルチエージェントシステムでの活用
- メインエージェントとサブエージェントの並列探索パターン
- 意図分類など初期ステップでの高速モデルの活用
開発者や企業のAI導入担当者にとって、コストを抑えながら信頼性の高いAIシステムを構築するための具体的なモデル選定基準とアーキテクチャ設計のヒントを得られる内容です。
📺 Introducing Gemini 3.7 Flash
Gemini 3.7 Flash:コーディングとエージェント向け新モデルのデモ
▼
Gemini 3.7 Flashは、コーディングとエージェント向けに設計されたモデルです。デモでは、アニメーションスプライトを使った90年代風ゲームを1レベル構築し、プロンプトの変更だけでゲーム全体を別コンセプトに作り替える様子を紹介しています。
■ ゲーム開発デモ
- 90年代風スプライトゲームの構築とNano Bananaによるアセット生成
- プロンプト変更による「Pizza Rush」へのリミックス
■ モデルの改善点
- デバッグ、Web開発、デザイン指示への追従性の向上
- Google anti-gravity、AI Studio、Gemini APIでの提供開始
コーディングやゲーム開発、プロンプト活用に興味がある方に向けて、新しいモデルの特徴を確認できる内容です。
📺 How builders at YC Startup School are using Gemini & Google AI
YC Startup Schoolアフターパーティーで語るAI活用の実践例
▼
YC Startup Schoolのアフターパーティーで、創業者やエンジニア、学生が自社の取り組みとAI活用について語る様子を収録しています。実際のユースケースを通じて、Gemini、Gemma、AlphaFoldといったAIモデルの特徴が紹介されます。
■ ビジネス現場での文書解析
- RAMPのインターンがGemini 3.1 Flashで領収書を解析
- 世界中のUber領収書など多言語文書に対応
■ 創業者によるAI活用
- AIを共同創業者と位置づけ、Geminiの高速プランニングモードやコンテキストウィンドウを評価
■ 研究・学習での活用
- AlphaFoldで細菌変異を可視化し抗生物質耐性を研究
- Geminiのディープリサーチモードで神経科学の研究を支援
- 機内でGemmaをダウンロードし学習に活用
スタートアップや研究の現場でAIをどう活用するかに関心がある方に、具体的なユースケースを把握するきっかけを提供します。
📺 Introducing Gemini Robotics 2
Gemini Robotics 2発表:汎用ロボットの知能層と身体性推論モデルの最前線
▼
Google DeepMindのチームが、新しい「Gemini Robotics 2」モデル群と身体性推論(Embodied Reasoning)モデルの発表について解説します。ロボットの全身制御、器用な操作、複数ロボットの協調など、今回のリリースの概要と、そこに至る研究の歩みを紹介します。
■ 発表の概要
- Gemini Robotics 2の3つの柱:全身知能、器用さ、複数ロボット協調
- 身体性推論モデル(ER 2.0)の提供開始とAPI・AI Studioでの利用
■ 研究の歩みと課題
- 強化学習、LLM/VLM、トランスフォーマー、VLAなどロボット研究の歴史
- 器用な操作が残る大きな課題と、物理的相互作用データの不足
■ デモ・安全性・展望
- 高自由度ハンドによるZiploc袋、電球、ゴミ袋の結び目などのデモ
- 安全性ベンチマーク「Asimov Agentic」と家庭用ロボット実用化の見通し
ロボット工学やAIの最新動向に関心のある視聴者にとって、Gemini Robotics 2の技術的な位置づけと今後の展開を理解するのに役立つ内容です。
📺 Voice Agent observability with LangSmith
Google ADKとGemini Liveで構築した音声エージェントをLangSmithでトレースする方法
▼
Google ADKとGemini Liveで構築した音声エージェントの内部動作を可視化するため、LangSmithへのトレース設定手順を解説します。Gemini Liveの音声直接入出力の仕組みや、会話音声の記録方法、トレース結果の活用方法までを紹介します。
- Gemini Liveの音声直接入出力による低遅延・自然な応答の仕組み
- LangSmithトレース統合の設定手順(プラグイン定義、ランナー登録)
- 会話音声の記録方法と割り込み時の扱い
- トレースで確認できる内容(文字起こし、ツール呼び出し、コスト情報など)
音声エージェントを本番運用に近づけたい開発者向けで、トレース設定から結果の活用方法までを学べます。LangSmithのドキュメントを参照しながら、自身のエージェントにトレースを導入してみましょう。
📄 このページの紹介文は AI が独自に生成したものであり、著作権をはじめとする他者の権利(商標権・名誉権・プライバシー等)を侵害しないよう配慮しています。動画の著作権は各作成者に帰属します。