📢 X投稿文
リアルタイム音声・動画同期型デジタルアバター。Wav2Lipで唇形を同期、声クローニング対応で商用利用可能
https://github.com/shibing624/AIAvatar
🤖 AI考察
■ 概要
リアルタイムインタラクティブなデジタルアバター基盤。wav2lipによる唇形同期とTTS音声クローニングで、商用品質の音視同期対話を実現。
■ 特徴・用途
- **技術スタック**: wav2lip(リップシンク)+ 音声クローニング + WebRTC で高精度な音映像同期
- **分散処理設計**: フロント/バック分離、GPU上のモデル推論 + CPU上のサービス分離で複数並行対応(ライブ配信・顧客対応・クローン話者の無限並行が可能)
- **実用機能**: 話者割込み対応、アクション編成(無音時の自然な動作挿入)により UX を向上
■ 結論
アーキテクチャが実装段階まで整理されており、GPU/CPU 分散と並行性を考慮した設計。動画生成 AI × リアルタイム通信 × マルチワーカーの基盤として、kurage や kcomicの TTS/動画ベースラインの選択肢に値する。