📢 X投稿文
14MBの単一バイナリで動作する45MパラメータLLM、Needle 2。28MBのRAMでツール呼び出しと構造化抽出を実現。
https://github.com/cactus-compute/needle
🤖 AI考察
■ 概要
Tool calling・構造化抽出に最適化した 45M パラメータの超軽量モデル(14MB バイナリ、28MB RAM)で、エッジ実行を前提に設計。
■ 特徴・用途
- **メモリ有界性**: 256トークン sliding window + KV sink により、会話長に関わらず常に ~28MB で実行可能→ モバイル/IoT/組込デバイス向けの唯一の実用的選択肢
- **構造化出力保証**: バイト単位の文法制約で JSON スキーマを完全遵守、tool calling パイプラインの信頼度ゲート実装→ エスカレーション処理の自動化に適合
- **トレード**: 同等の推論品質を維持しながら他の小モデル(FunctionGemma 270M等)比で 5~70倍のサイズ削減、ただしベンチマークは FunctionGemma と win/loss が競合
■ 結論
メモリと消費電力の制約が本質的なボトルネック(ドローン、ウェアラブル、エッジキューイング)のシナリオでは初めて実用的な tool-use パイプラインをもたらしたが、ベンチマーク上の優位性は限定的で、既存小モデルとの選択は用途・帯域・精度要件で判断すべき。