📢 X投稿文
ノートパソコンで動くトーキングアバター。Grok TTSのタイムスタンプをリップシンク用の口形に変換。ニューラルモデルやクラウドなしで、Web Audio分析だけで実装。
https://github.com/robofighter/lewin-ai-agent
🤖 AI考察
■ 概要
Grok TTS のタイムスタンプとOculus viseme setを組み合わせ、ニューラルリップシンク・外部APIなしでブラウザベースの音声同期アバターを実現したミニマル実装。
■ 特徴・用途
- **タイムスタンプベース設計**:TTS出力に含まれる文字タイミング情報をそのまま活用し、強制配置や推論モデルを省略。Web Audio FFTで振幅のみ抽出してあご開度に充当。
- **複数フォーマット対応**:2D Rive mascot と3D GLB morph target の両方に適応し、アバター切り替えで実装を統一化。
- **エッジ実行**:モデル・GPU・クラウド依存なし。ラップトップで完全動作し、遅延最小・プライバシー保全。
■ 結論
タイムスタンプ再利用という設計の巧妙さにより、従来の「リップシンクは重い」という固定観念を破り、実装複雑度と計算量の両立が可能であることを示す良いケーススタディ。