
研究人員測試 AI 對信任、偏見或使用習慣的影響時,往往要自行處理分支流程、隨機分組、對話介面與事件記錄。Gricea提供一個開放平台,讓團隊在同一套工作流內設計受控的 Conversational AI 研究、收集互動資料,並比較不同研究設計。Gricea 就是把這整套東西做成一個可運行、可分享的研究實驗。
用一個例子說明,假設你想研究:「廣東話 AI 客服,用 GPT 類模型還是本地模型,使用者會覺得較有幫助?」
你通常要自己做很多東西:
-做一個受試者能使用的聊天網頁
-設定 chatbot 用哪個模型、system prompt、知識庫與工具
-把受試者隨機分兩組:A 組用模型 A,B 組用模型 B
-安排任務,例如「請 AI 幫你處理退貨」
-收集聊天紀錄、完成時間、滿意度問卷
-確保別人日後可以用同一個流程再做一次
平台以可編輯的視覺流程建立器編排研究,支援 within-subject 和 between-subject 設計、隨機化、條件分支及邏輯控制。研究人員亦可加入 LLM 聊天介面、bias manipulation、RAG-based context retrieval 和 streaming responses,觀察模型設定或對話脈絡改變後,參與者行為如何變化。
• 記錄訊息、點擊及其他行為事件
• 連結參與者路徑、回應、replay 和研究層級分析
• 以 consent 版本管理、遮罩 replay,限制研究資料存取
Gricea 同時提供參與者管理、資料分析、研究分享及公開研究瀏覽功能,公開項目可以作為其他研究的模板。研究團隊可研究「奉承式 AI 如何改變信任」等問題,也可比較 RAG 介面、對話風格或教育問卷設計;平台的價值在於保留完整 study artifact,方便其他人檢視、修改及重新部署。對需要可重現流程、細緻互動記錄和社群協作的 Conversational AI 研究尤其合適,但資料貢獻仍涉及私隱及同意範圍,研究團隊需要自行界定收集與分享的界線。