OmniEdu 把課程理解帶進 AI

OmniEdu 不只回答題目,還會對照課程、診斷學習缺口,再決定下一步應給提示、提問或講解。

Repository image for haolpku/Omni-Edu

學生卡在一道題目時,答案本身未必足夠,真正需要的是知道漏了哪個前置概念,以及下一步應怎樣學。OmniEdu 屬於開源多模態模型家族,處理 K–12 學習與教學流程,將課程對應、解題、學習診斷和教學支援放在同一套模型內。

模型以 Qwen3.5-4B-Base、Qwen3.5-9B-Base 和 Qwen3.8-27B 為基礎,推出 4B、9B、27B 三個 checkpoint。訓練資料包括 69,999 個 instruction examples、15.96M supervised response tokens,當中 60,951 個屬教育專用資料,涵蓋超過 100 個來源;模型亦支援圖片等多模態輸入,能把問題、知識點、年級、先修關係和課程證據連繫起來。

可下載的權重和資料集適合教育研究團隊、教材平台,以及需要本地模型作學習分析的開發者;4B 較適合本地試驗,9B 和 27B 則提供更高能力但需要更多硬件資源。模型可透過 Transformers 或 vLLM 執行,公開配置使用 Qwen3_5ForConditionalGeneration,訓練序列長度為 32,768 tokens。

  • OmniEdu-27B 在 16 個模型比較中,取得 K12-Bench EM 63.12% 和 F1 76.69%,兩項均列第一。
  • OmniEdu-27B 在 MathFish 達 85.89% 準確率,並取得 LongTutor 3.02 教學分數。
  • EDUMATH MaC 為 86.95%,MathTutorBench Scaffold win rate 為 78.74%,兩項均列第二。
  • 模型的差異不只在答對題目,而是嘗試判斷誤解、缺失的先修知識,再選擇提示、引導問題、複習或解釋。

OmniEdu 的取捨也很直接:全參數 supervised fine-tuning 和長序列訓練有助整合教育情境,但 27B checkpoint 對硬件要求較高,模型的教學判斷亦應配合教師審核。對只需要一般問答的工作流程,它可能過於專門;對重視課程對齊和個別學習支援的團隊,公開權重與資料集則提供了可檢查、可延伸的起點。

項目主頁 · GitHub

Categories: 開源, 北京大學, 模型, 多模態模型, 模型訓練, Image, 教學, Dataset 數據集