📢 X投稿文
VibeVoice ComfyUIノード。最大4人の多話者TTS、音声クローニング、LoRA微調整対応。8bit量子化で省メモリ
https://github.com/Enemyx-net/VibeVoice-ComfyUI
🤖 AI考察
■ **概要**
MicrosoftのVibeVoiceをComfyUIに統合したTTSノード群。画像生成ワークフロー内でテキスト音声合成を一元化する。
■ **特徴・用途**
- **マルチスピーカー+ボイスクローニング**: 最大4スピーカーの会話生成と参照音声クローニングで、キャラクター音声・ナレーション生成の自動化に適する。
- **メモリ最適化**: 4/8-bit量子化+MPS/CUDA対応で、ローカルGPU実行の敷居を大きく下げている。実装はLORA微調整・速度調整・ポーズタグなどComfyUI向けに細部まで実装済み。
- **実務向け**: テキストチャンキング・ノードチェーン・中断機能など、長尺生成・複合ワークフローに対応。
■ **結論**
機能は充実しているが、品質(自然性・話者多言語対応)の公開情報がなく、実運用前に実測検証が必須——特にクローニング品質とモデルの学習言語が不明。