大模型推理變準論文,不一定要微調
也不用讓它多思考幾遍
改"思考過程"裡的一箇中間變數就行
這是篇新論文的做法論文,名字叫 GradCuit
論文團隊包括北京通用人工智慧研究院、中國科學院自動化研究所、北京郵電大學人工智慧學院、北大人工智慧學院論文。
作者之一就有北京大學朱松純教授論文。
論文我讀完的理解:把一段可調的隱狀態插進 Transformer 中間層論文,模型權重一個不動,答錯了就把梯度直接傳回去調它
【以前的隱推理為啥不夠】
調整點放在輸出端論文,梯度得穿過解碼層繞回來
訊號又混又弱論文,經常調了個寂寞
換成中間層之後論文,自注意力自帶雙向通路
所有 Token 的梯度都能直接回傳
【資料說人話】
5 個模型、3 個基準、30 組實驗
平均 64.5%論文,比普通 CoT 高 6.6 個點
比同類方法高 2.4 個點
兩個我比較在意的點論文:
1、對學習率不敏感論文,步長隨便設都穩
2、平均 2.42 輪就收斂論文,比反覆取樣幾遍省事
還有個反直覺的細節
梯度歸因顯示它主要作用在 because、then 這類連線詞上
也就是在調"思考邏輯"論文,不是偷偷改答案
程式碼和專案頁都開源了論文,想細看搜 GradCuit
你們現在做大模型推理論文,卡在哪個環節?
評論區聊聊#小紅書熱點觀察團# #人工智慧# #大模型# #北京大學# #AI工具# #科技# #小紅書科技觀察團# #多模態人工智慧# #科研# #帶你一起讀論文#
論文。作者之一就有北京大學朱松純教授。論文我讀完的理解..." alt="大模型推理變準,不一定要微調也不用讓它多思考幾遍改"思考過程"裡的一箇中間變數就行這是篇新論文的做法,名字叫 GradCuit論文團隊包括北京通用人工智慧研究院、中國科學院自動化研究所、北京郵電大學人工智慧學院、北大人工智慧學院。作者之一就有北京大學朱松純教授。論文我讀完的理解...">