📢 X投稿文
音声対話型デジタル人間。3秒の首包遅延で実時間応答。音色クローニングと形象カスタマイズ対応、低メモリ級化方案も実装
https://github.com/Henry-23/VideoChat
🤖 AI考察
## VideoChat 技術考察
### 1. アーキテクチャの二層設計
■ エンドツーエンド(MLLM-THG)とカスケード(ASR-LLM-TTS-THG)を両立、用途に応じて選択可能
■ カスケード方式は首包延遅3秒・メモリ8GB で低コスト実装。エンドツーエンドは音声直解釈で応答品質を優先(7秒・20GB)。単一オプションではなく「選べる」設計が、異なるハードウェア環境での展開を加速
■ 依存モジュール(FunASR/Qwen/MuseTalk)が独立していることで、各層を段階的にカスタマイズできる拡張性がある
### 2. レイテンシー最小化の実装パターン
■ 首包延遅3秒は、リアルタイム対話の実用最低水準。カスケード方式で各ステップを直列化しながらも達成
■ TTS に GPT-SoVITS・CosyVoice・edge-tts 複数対応=ローカル推論(低遅延)と外部API(品質)を用途で切り替え。音色クローンサポートも実装済み
■「首包延遅の計測と公開」が他のデジタル人間デモと異なる——ユーザーが本番環境で期待値を立てやすい
### 3. 重み・形象・音色の柔軟性
■ ModelScope の git-lfs で大型重み一括配置、ローカルデプロイを単純化。カスタム形象・音色に対応
■ MuseTalk による顔アニメーション生成で、汎用の人物画像から表情をつけられる。テンプレート型(事前録音)でなく、プロンプト応答ごとに動的生成が可能
■ Talking Head Generation の汎用化により、ユースケース固有の形象を安価に実装できる土台