海外動画の内容を AI が日本語に翻訳・要約。登録不要で読める動画要約・翻訳ページ
📺 Agentic video understanding in Gemini
紹介を準備中です…
▼
📺 How to build with Gemini 3.5 Transcribe
Geminiベースの文字起こしモデル「Gemini 3.5 Transcribe」の紹介とデモ
▼
Geminiを活用した新しい文字起こしモデル「Gemini 3.5 Transcribe」を発表します。Interactions APIとLive APIの両方で利用でき、従来のモデルが苦手とする英数字やメールアドレス、電話番号などの認識精度を高めます。
■ 主な機能と設定
- カスタム語彙の指定による固有名詞の認識向上
- 言語ヒントの設定による文字起こし精度の向上
- 70以上の言語の自動認識と多言語対応
■ デモで示された活用例
- メールアドレスや電話番号の正確な文字起こし
- 単位や数値表現の適切な変換(100 cm → 1 m など)
- 英語とドイツ語の混在や言語間の数値表現の違いへの対応
リアルタイム文字起こしや高精度な文字起こしを必要とするアプリケーション開発者に向けて、具体的な設定方法とデモを通じて活用イメージを提供します。Interactions APIとLive APIで試用できます。
📺 Build a live translation broadcast app with the Gemini Live API and LiveKit
Gemini 3.5 Live翻訳モデルを活用したライブ翻訳ブロードキャストデモの解説
▼
本動画では、Gemini APIで新しく利用可能になったGemini 3.5 Live翻訳モデルを使い、ライブ音声を多言語へ同時翻訳して配信するデモアプリケーションを紹介します。LiveKitとGoogle Cloud Runを組み合わせた実装方法や、翻訳セッションの管理、デプロイ手順までを解説します。
■ デモの概要と動作の仕組み
- イベントIDを利用したLiveKitルームへの音声配信
- 視聴者が選択した言語ごとにGemini Live翻訳セッションを起動
- 同じ言語の視聴者は既存セッションを共有し、リソースを効率化
■ アプリケーションの構成と実装
- Next.jsとLiveKitを使用した構成
- Gemini Live APIへのWebSocket接続と音声・字幕データの配信
- 翻訳ブリッジのセッション管理の仕組み
■ Google Cloud Runへのデプロイ方法
- DockerfileとSecret Managerを利用したセットアップ
- デプロイコマンドと認証設定
- スケーリングの制約と対応方針(最大インスタンス数、同時言語数の上限など)
■ 対象者と得られる知識
- Gemini APIやLiveKitを活用したリアルタイム翻訳システムの構築方法を学びたい開発者向けです。デモのソースコードは公開されており、実際のイベントでの利用例や、スケール時の設計判断についても知ることができます。
📺 Hands on with Gemini 3.7 Flash
Gemini Flash 3.7で実現するエンタープライズAIの効率化とコスト最適化
▼
エンタープライズ向けAI活用の現場では、大量の文書処理や日々の意思決定を支えるモデルに、精度だけでなく効率性とコスト競争力が求められています。本内容では、Gemini Flash 3.7がもたらすトークンコストの削減や低レイテンシーを活かしたモデル選択の考え方、マルチエージェントシステムにおける活用方法が具体例とともに紹介されます。
■ エンタープライズAIの課題とGemini Flash 3.7の役割
- 保険や金融などでの大量文書処理とスケール要件
- 1日100万件の意思決定をデータに基づいて行う必要性
■ コストと精度を両立するモデル選択
- 「最小 viable モデル」の考え方と過剰投資の回避
- 3.6から3.7へのトークンコスト削減とレイテンシー改善
■ マルチエージェントシステムでの活用
- メインエージェントとサブエージェントの並列探索パターン
- 意図分類など初期ステップでの高速モデルの活用
開発者や企業のAI導入担当者にとって、コストを抑えながら信頼性の高いAIシステムを構築するための具体的なモデル選定基準とアーキテクチャ設計のヒントを得られる内容です。
📺 Introducing Gemini 3.7 Flash
Gemini 3.7 Flash:コーディングとエージェント向け新モデルのデモ
▼
Gemini 3.7 Flashは、コーディングとエージェント向けに設計されたモデルです。デモでは、アニメーションスプライトを使った90年代風ゲームを1レベル構築し、プロンプトの変更だけでゲーム全体を別コンセプトに作り替える様子を紹介しています。
■ ゲーム開発デモ
- 90年代風スプライトゲームの構築とNano Bananaによるアセット生成
- プロンプト変更による「Pizza Rush」へのリミックス
■ モデルの改善点
- デバッグ、Web開発、デザイン指示への追従性の向上
- Google anti-gravity、AI Studio、Gemini APIでの提供開始
コーディングやゲーム開発、プロンプト活用に興味がある方に向けて、新しいモデルの特徴を確認できる内容です。
📺 How builders at YC Startup School are using Gemini & Google AI
YC Startup Schoolアフターパーティーで語るAI活用の実践例
▼
YC Startup Schoolのアフターパーティーで、創業者やエンジニア、学生が自社の取り組みとAI活用について語る様子を収録しています。実際のユースケースを通じて、Gemini、Gemma、AlphaFoldといったAIモデルの特徴が紹介されます。
■ ビジネス現場での文書解析
- RAMPのインターンがGemini 3.1 Flashで領収書を解析
- 世界中のUber領収書など多言語文書に対応
■ 創業者によるAI活用
- AIを共同創業者と位置づけ、Geminiの高速プランニングモードやコンテキストウィンドウを評価
■ 研究・学習での活用
- AlphaFoldで細菌変異を可視化し抗生物質耐性を研究
- Geminiのディープリサーチモードで神経科学の研究を支援
- 機内でGemmaをダウンロードし学習に活用
スタートアップや研究の現場でAIをどう活用するかに関心がある方に、具体的なユースケースを把握するきっかけを提供します。
📺 Introducing Gemini Robotics 2
Gemini Robotics 2発表:汎用ロボットの知能層と身体性推論モデルの最前線
▼
Google DeepMindのチームが、新しい「Gemini Robotics 2」モデル群と身体性推論(Embodied Reasoning)モデルの発表について解説します。ロボットの全身制御、器用な操作、複数ロボットの協調など、今回のリリースの概要と、そこに至る研究の歩みを紹介します。
■ 発表の概要
- Gemini Robotics 2の3つの柱:全身知能、器用さ、複数ロボット協調
- 身体性推論モデル(ER 2.0)の提供開始とAPI・AI Studioでの利用
■ 研究の歩みと課題
- 強化学習、LLM/VLM、トランスフォーマー、VLAなどロボット研究の歴史
- 器用な操作が残る大きな課題と、物理的相互作用データの不足
■ デモ・安全性・展望
- 高自由度ハンドによるZiploc袋、電球、ゴミ袋の結び目などのデモ
- 安全性ベンチマーク「Asimov Agentic」と家庭用ロボット実用化の見通し
ロボット工学やAIの最新動向に関心のある視聴者にとって、Gemini Robotics 2の技術的な位置づけと今後の展開を理解するのに役立つ内容です。
📺 Voice Agent observability with LangSmith
Google ADKとGemini Liveで構築した音声エージェントをLangSmithでトレースする方法
▼
Google ADKとGemini Liveで構築した音声エージェントの内部動作を可視化するため、LangSmithへのトレース設定手順を解説します。Gemini Liveの音声直接入出力の仕組みや、会話音声の記録方法、トレース結果の活用方法までを紹介します。
- Gemini Liveの音声直接入出力による低遅延・自然な応答の仕組み
- LangSmithトレース統合の設定手順(プラグイン定義、ランナー登録)
- 会話音声の記録方法と割り込み時の扱い
- トレースで確認できる内容(文字起こし、ツール呼び出し、コスト情報など)
音声エージェントを本番運用に近づけたい開発者向けで、トレース設定から結果の活用方法までを学べます。LangSmithのドキュメントを参照しながら、自身のエージェントにトレースを導入してみましょう。
📺 Android Studio Quail 2, the Build with Gemini XPRIZE, and more! - Google Developer News July 2026
Android Studio Quail 2安定版、Android Bench更新、Gemini XPRIZEなどGoogle開発者ニュース
▼
Google開発者向けの最新情報をまとめた動画です。Android Studio Quail 2の安定版リリース、Android Benchの評価更新、YouTubeのAIプロトタイプ開発技術スタック、総額200万ドルのGeminiハッカソンについて紹介します。
■ Android Studio Quail 2安定版
- 並行マルチエージェントによる複数タスクの同時実行
- LeakCanaryのProfiler統合によるメモリリーク検出の高速化
- App Quality Insightsのエージェントモードでクラッシュ修正を支援
■ Android Bench評価更新
- 新モデル追加とHarborフレームワークによる標準化
- 独自タスクの提出とコミュニティ共有が可能
■ Emergentシリーズ
- YouTubeのAIプロトタイプ開発技術スタックを解説
■ Build with Gemini XPRIZE
- 総額200万ドルの賞金、5カテゴリで競う
- 8月17日までにプロトタイプと実収入の提出が必要
Android開発者やAIプロトタイプ構築に関心のある視聴者向けです。最新ツールの活用方法やコンテスト参加の機会を得られます。
📄 このページの紹介文は AI が独自に生成したものであり、著作権をはじめとする他者の権利(商標権・名誉権・プライバシー等)を侵害しないよう配慮しています。動画の著作権は各作成者に帰属します。