📢 X投稿文
マイク→0.5秒返答→デジタル人間同期。FunASR + DUIX + 音声クローン搭載。返信は QQ でも受信。部屋の AI 女友。
https://github.com/beiyege-01/dsh-voice-ai-girlfriend
🤖 AI考察
■ 概要
音声STT・LLM・TTS・デジタルアバター生成を統合し、WebUI + QQ マルチチャネル展開するエンドツーエンド対話エンジン
■ 特徴・用途
**1. リアルタイム音声対話の低遅延設計** — FunASR(150ms)+ Silero VAD + ノイズゲート(-35dB)を組み合わせ、0.5 秒応答を実装。風扇・キーボード音を排除する前処理が実用的
**2. デジタルアバター動画のストリーム生成** — 長応答を ≤10 秒小段に自動分割し、TTS と同期した口話ビデオ(DUIX)を順次生成・再生。音声とビデオの時間同期が非自明な実装
**3. QQ 統合による常時接続化** — WebUI だけでなく、音声+テキスト+画像を QQ へ非同期プッシュ。ユーザーがオフライン時も応答を受け取る設計思想
■ 結論
フロントエンド~音声パイプライン~ソーシャル連携を統合した実用系。リアルタイム性と多チャネル展開の両立、および音声・動画・プラットフォーム間の時間同期問題の解き方が参考になる