大模型推理變準,不一定要微調也不用讓它多思考幾遍改"思考過程"裡的一箇中間變數就行這是篇新論文的做法,名字叫 GradCuit論文團隊包括北京通用人工智慧研究院、中國科學院自動化研究所、北京郵電大學人工智慧學院、北大人工智慧學院。作者之一就有北京大學朱松純教授。論文我讀完的理解...

大模型推理變準論文,不一定要微調

也不用讓它多思考幾遍

改"思考過程"裡的一箇中間變數就行

這是篇新論文的做法論文,名字叫 GradCuit

論文團隊包括北京通用人工智慧研究院、中國科學院自動化研究所、北京郵電大學人工智慧學院、北大人工智慧學院論文

作者之一就有北京大學朱松純教授論文

論文我讀完的理解:把一段可調的隱狀態插進 Transformer 中間層論文,模型權重一個不動,答錯了就把梯度直接傳回去調它

【以前的隱推理為啥不夠】

調整點放在輸出端論文,梯度得穿過解碼層繞回來

訊號又混又弱論文,經常調了個寂寞

換成中間層之後論文,自注意力自帶雙向通路

所有 Token 的梯度都能直接回傳

【資料說人話】

5 個模型、3 個基準、30 組實驗

平均 64.5%論文,比普通 CoT 高 6.6 個點

比同類方法高 2.4 個點

兩個我比較在意的點論文

1、對學習率不敏感論文,步長隨便設都穩

2、平均 2.42 輪就收斂論文,比反覆取樣幾遍省事

還有個反直覺的細節

梯度歸因顯示它主要作用在 because、then 這類連線詞上

也就是在調"思考邏輯"論文,不是偷偷改答案

程式碼和專案頁都開源了論文,想細看搜 GradCuit

你們現在做大模型推理論文,卡在哪個環節?

評論區聊聊#小紅書熱點觀察團# #人工智慧# #大模型# #北京大學# #AI工具# #科技# #小紅書科技觀察團# #多模態人工智慧# #科研# #帶你一起讀論文#

論文。作者之一就有北京大學朱松純教授。論文我讀完的理解..." alt="大模型推理變準,不一定要微調也不用讓它多思考幾遍改"思考過程"裡的一箇中間變數就行這是篇新論文的做法,名字叫 GradCuit論文團隊包括北京通用人工智慧研究院、中國科學院自動化研究所、北京郵電大學人工智慧學院、北大人工智慧學院。作者之一就有北京大學朱松純教授。論文我讀完的理解...">

本站內容來自使用者投稿,如果侵犯了您的權利,請與我們聯絡刪除。聯絡郵箱:835971066@qq.com

本文連結://yxd-1688.com/post/61791.html

🌐 /