📢 X投稿文
StreamSpeech: 1つのモデルでリアルタイム音声翻訳を実現。ストリーミング音声認識、同時テキスト翻訳、同時音声翻訳をマルチタスク学習で統合。オフライン・ストリーミング双方でSOTA性能を達成
https://github.com/ictnlp/StreamSpeech
🤖 AI考察
■ 概要
リアルタイム同時音声翻訳を実現するマルチタスク学習モデルで、ストリーミングASR・SLT・S2STの3タスクに統一アーキテクチャで対応。
■ 特徴・用途
- **低遅延化の工夫**: 従来の「音声→テキスト→テキスト翻訳→音声合成」のカスケード方式と異なり、単一モデルで直接S2STを実行するため、パイプライン遅延が累積しない。会議・同時通訳など人間が介入する場面では、従来方式の数秒→100ms単位での応答短縮が活用価値。
- **マルチタスク学習のスケール効率**: ASR・翻訳・TTS情報を同時学習することで、中低資源言語対でも単一タスク学習より少ないデータで収束。言語ペア追加時の学習コスト削減。
- **ストリーミング推論対応**: 音声入力の到着と並行して部分的に処理・翻訳出力を生成でき、完全な入力待機が不要。実装ではプリフィックスに基づく段階的翻訳(wait-k メカニズム等)で遅延と精度のトレードオフ調整が可能。
■ 結論
音声翻訳の「低遅延+高精度+多言語対応」のトリレンマを、マルチタスク設計とストリーミング推論で現実的に解く手法で、実時間翻訳が必要なアプリケーション向けの基盤技術として有用。