LiquidAIが発表した「LFM2.5-VL-3B」は、約30億パラメータの軽量視覚言語モデルであり、モバイル端末での高速な視覚理解とリアルタイム処理を実現する。これにより、クラウドを介さずエッジAIの活用領域が劇的に拡大する可能性を秘めている。
LiquidAIの最新モデル「LFM2.5-VL-3B」は、SigLIP2 400M視覚エンコーダーとLFM2.5-2.6Bテキストモデルを統合し、約34兆トークンのデータで事前学習された。LiquidAIの技術文書によれば、推論ステップを挟まず直接回答を生成する「非推論型」設計を採用することで、エッジ環境で不可欠な低レイテンシを実現している。この設計が、デジタル画面のUI理解といった実用的なタスクにおいて、オンデバイスでの高速処理を可能にした主要因であると考えられる。
LFM2.5-VL-3Bは、その軽量性にもかかわらず驚異的な推論速度を誇る。LiquidAIの発表によれば、Apple M5 Max搭載機では228トークン/秒、Galaxy S26 Ultraでも20トークン/秒という実用的なデコード速度を達成している。これは約3GBのメモリに収まるサイズで実現されており、オンデバイスAIの普及を加速させる。機能面では、単なる画像認識を超え、デジタル画面のUI理解や自然言語による物体検出、マルチ画像入力への対応など、実務的なタスクに最適化されている点が特筆される。
LFM2.5-VL-3BがクラウドAPIへの依存を脱却し、ローカル環境で完結する「インテリジェントな視覚」を可能にすることは、プライバシー保護とリアルタイム性が重視される現場にとって大きな意義を持つ。医療現場の診断支援システムや製造ラインの品質管理を行うIoTデバイス、あるいは常時起動が求められるパーソナルアシスタントの基盤として、データがデバイス外に送信されない安心感と即時応答性は、導入のハードルを大幅に下げる。これは、現場の運用コストやデータレジデンシーの課題解決にも寄与すると見られる。
LFM2.5-VL-3Bが真に普及するためには、軽量モデル特有の限界をどこまで克服できるかが焦点となる。約30億パラメータというサイズは、高度な論理的推論や複雑なマルチモーダルタスクにおいて、大規模モデルと比較すれば限界があることは否めない。また、多言語対応のために語彙数を倍増させる手法が採用されているが、これが非英語圏の言語処理において、どの程度の精度と実用性を維持できるかは、今後の実運用での検証が不可欠である。汎用的な推論能力と軽量化のトレードオフが、今後のモデル改善の鍵を握ると考えられる。