Spark-X2.5:4B 參數追平 12B

Spark-X2.5-4B 用混合架構把 1M token 上下文塞進小模型,並在編碼與 Agent 場景追上 12B 等級對手。

Og image

Spark-X2.5-4B 由 XHToken 發佈,基礎模型標註為 XHToken/Spark-X2.5-4B-Base,屬於通用對話型 LLM,覆蓋寫作、翻譯、推理、編碼、工具調用與 Agent 工作流。「小模型也能扛長上下文」這條路線:採用 1 層全注意力 + 3 層滑窗注意力(sliding-window attention)的混合架構,把長序列的計算成本壓低,同時原生支援最長 1M token 上下文。對本地開發者而言,這代表不必依賴昂貴的長上下文方案,也能處理長文檔或多輪 Agent 記錄。

模型在 Agent 整合上做了明確適配,與 Codex、Claude Code、OpenClaw、Hermes 等主流 agent harness 對齊,讓它在編碼與工具調用評測中,在同尺寸開源模型裡取得領先位置。對想自架本地 Agent 的人來說,這層適配省去不少 prompt 與調用格式的微調工作。

部署兼容性是它的另一個賣點:原生支援 NVIDIA、華為、海光、HOUMO.AI 等硬件平台,推論框架覆蓋 vLLM、SGLang、llama.cpp、MLX,亦可透過 Ollama、LM Studio 快速啟動。頁面提供 Hugging Face Transformers 格式的權重與配置,授權為 Apache-2.0。

Spark-X2.5-4B 適合追求長上下文與 Agent 能力、又受限於硬件預算的開發者,但要實際部署前宜留意量化檔案與推論引擎的官方更新。

重點摘要:
基礎模型:基於 XHToken/Spark-X2.5-4B-Base 微調的對話模型
混合注意力架構:1 層全注意力 + 3 層滑窗,原生支援 1M token 上下文
Agent 整合:適配 Codex、Claude Code、OpenClaw、Hermes 等主流 agent harness
硬件與推論支援:涵蓋 NVIDIA、華為等平台,兼容 vLLM、SGLang、llama.cpp、MLX,可走 Ollama 與 LM Studio
授權:Apache-2.0;頁面未列出 GGUF 量化檔,部署前需留意官方或社群進度

項目主頁 · 項目

Categories: 開源, Agentic, 模型, OpenClaw, 框架