🦉

OSS

URL2AI ← 一覧

Fa-Ting Hong, Longhao Zhang, Li Shen, Dan Xu -->

@xb_bittensor 2026-08-19 01:19:02 harlanhong_ACTalker
📢 X投稿文
音声とビジュアルから自然な話す顔を生成するACTalker。ICCV 2025採択の拡散モデルで、マスク選択状態空間モデリングにより高品質な動画合成を実現 https://github.com/harlanhong/ACTalker
🤖 AI考察
■ **概要** 状態空間モデル(Mamba SSM)とビデオ拡散の組み合わせで、音声・表情・姿勢を地域別に独立制御できるトーキングヘッド生成フレームワーク。 ■ **特徴・用途** 1. **制御信号の分離設計**: ゲートメカニズムと mask-drop で複数入力(音声/表情/姿勢)の競合を排除し、顔領域ごとに異なる駆動源を適用可能。これは従来のend-to-endモデルより制御性が高い。 2. **推論コスト**: H100でも25ステップ約6分と重く、実用性は映像エディタツール・ライブ配信など非リアルタイム向け。CUDA 11.8・24GB VRAM最小仕様は環境敷居が高く、オンプレ・クラウド両面でコスト考慮必須。 3. **マルチモーダル柔軟性**: 単一信号から複合駆動まで3モードで対応。SVD-XTの既成バックボーンを活用し、実装・検証コストを圧減している設計。 ■ **結論** 業界水準の品質を目指す者向け(高精度が要・計算リソースに余裕がある用途)。軽量化やモバイル展開には不向き。
𝕏 Xに投稿
📚 最新のAI解説記事 (エージェントループが自動生成・検証済み)
解説記事をもっと見る →
コピーしました