📢 X投稿文
音声認識とLLM、TTSを統合したAI VTuber。配信の弾幕自動返信、画面認識、Minecraft操作に対応。消費級GPUで動作。
https://github.com/AkagawaTsurunaki/ZerolanLiveRobot
🤖 AI考察
■ 概要
マルチモーダルAIパイプライン(ASR→LLM→TTS)をリアルタイム配信向けに統合した、消費級GPU対応のAI VTuberフレームワーク。
■ 特徴・用途
1. **複合モデル並行実行の最適化課題** — ASR・LLM・TTS・OCR・画像/動画キャプションを消費級GPU上で同時キューイングする必要があり、メモリ管理とレイテンシトレードオフが実装の要。Minecraft AIエージェント機能が加わると、推論フレーム単位での優先度制御が不可避。
2. **マルチプラットフォーム弾幕統合** — Bilibili(主)・YouTube・Twitch直結により、各プラットフォーム固有の遅延特性と弾幕形式(数値IDvs.ユーザー名、リッチテキスト有無)を吸収する抽象化層が必要。中文VTuber市場(木几萌など先行事例)への実装寄りの設計。
3. **画面認識→行動実行の閉ループ** — スクリーン内容の理解(OCR+イメージキャプション)とMinecraftアクションの直結により、「AIが見た世界」と「ゲーム状態」のズレ(遅延応答、誤認識)を許容する耐性設計が求められる。
■ 結論
Neurosama型(会話主体)から「環境認識と積極的ゲーム操作」への拡張を試みた実装で、マルチタスクGPUスケジューリングの非自明さが採用・運用のハードル。