
Needle 2 屬於用於 tool calling 的小型模型,同時處理 device use 和 structured extraction。它把輸入文字轉成可直接接入工作流的結構化結果,適合在本地裝置、隔離網絡環境或資源很緊的情況下部署。
這個 Python package 提供 inference、LoRA fine-tuning 和 export,安裝後會先從 Hugging Face 下載一次 engine,再在本機快取,之後不再依賴網絡。開發者只要描述工具,模型就會按 schema 產生 JSON,並用 byte-level grammar 收窄輸出範圍,減少格式跑偏。
This 14MB AI Model Runs Locally — Needle 2 Explained
它和同類小模型的取捨很明確:45M 參數、單一 14MB binary,換來的是極低記憶體佔用和離線運行能力;官方測試也顯示,它會和 FunctionGemma 270M、LFM2.5 230M 及 Apple FM 互有勝負,但體積小得多。另一個做法是加入 confidence score,低於門檻就可以交回人工或上層流程處理。
- 單一引擎打包,部署時不用分開管理權重檔
- 以 JSON 與 schema 約束輸出,方便串接工具鏈
- 支援大量工具目錄,但每輪只取 top five
- 256-token sliding window 令記憶體維持在約 28MB
- 適合離線裝置、邊緣設備和需要穩定結構輸出的團隊