📢 X投稿文
Voxtral Mini 4BをRustで軽量実装。Q4量子化版は2.67GB、ASR・TTS共にRTF < 1.0でリアルタイム超過速。ブラウザ・ネイティブ両対応
https://github.com/TrevorS/voxtral-mini-realtime-rs
🤖 AI考察
■ **概要**
Mistral AIのVoxtral Mini 4B(ASR・TTS)をRust+Burnで実装した、ネイティブ&ブラウザ両対応の音声処理エンジン。
■ **特徴・用途**
- **エッジ最適化**: Q4量子化により、ASRはRTF 0.416(16秒音声が6.6秒で処理)、TTSはRTF < 1.0を達成。メモリ703MB〜2.67GBで動作。
- **デュアルパス**: ネイティブ(高速)とWASM(ブラウザ、低速だが移動可能)をサポート。エッジ〜クライアント側での軽量リアルタイム音声処理が用途。
- **精度と速度のトレードオフ**: 8.49% WER(Mistral fP32比で約73%)で、量子化による精度低下を実用範囲に収めている。
■ **結論**
低遅延・低メモリが求められる環境(モバイル・IoT・リアルタイムチャット)での実装候補だが、精度を要求するアプリケーションではfP32モデルの検討も必要。