📺 Introducing EmbeddingGemma 2: An open model for natively multimodal embeddings
Embedding Gemma 2は、テキスト・画像・動画・音声を単一の埋め込み空間にマッピングする軽量なオープンモデルです。その特徴と具体的な応用例、オンデバイスでの利用方法を紹介します。
■ モデルの概要と特徴
- マルチモーダル埋め込みを単一モデルで実現
- 740Mパラメータ、768次元(Matryoshkaで削減可能)
- 8000トークンのコンテキスト長
■ 応用例とカスタマイズ
- Google AI Edge Galleryでの画像検索とVideo Moment Finderによる動画内検索
- Gemma 4と組み合わせたRAGパイプラインとAI Edge Foresightでの音声質問応答
- 特定分野へのファインチューニング
- Hugging Faceからのモデル入手とGemmaガイドの参照
マルチモーダル検索やオンデバイスAIの開発に関心のある開発者に適しており、モデルの入手方法や具体的なユースケースを知ることができます。
この動画を紹介した Google for Developers の最新動画も、紹介付きで読めます。
📄 このページの紹介文は AI が独自に生成したものであり、著作権をはじめとする他者の権利(商標権・名誉権・プライバシー等)を侵害しないよう配慮しています。動画の著作権は各作成者に帰属します。