而這次的 R1 模型一出,不僅反駁了之前蒸餾 OpenAI o1 的說(shuō)法,官方更是直接下場(chǎng)表示:

值得一提的是, R1 突破了以往的模型訓(xùn)練形式,完全沒(méi)有使用任何 SFT 數(shù)據(jù),僅通過(guò)純粹的 RL 來(lái)訓(xùn)練模型,這一點(diǎn)說(shuō)明 R1 已經(jīng)學(xué)會(huì)了自己思考問(wèn)題——這實(shí)則更符合人類的思維規(guī)則。
并且在數(shù)學(xué)、代碼、自然語(yǔ)言推理上更是和 o1 正式版不相上下,在多個(gè)基準(zhǔn)測(cè)試中展現(xiàn)了卓越的性能。


如果你仍未真切領(lǐng)略到它的強(qiáng)大,那么請(qǐng)注意:它只需付出 o1 五十分之一的成本,卻能收獲 o1 百分之百的效能。

除了 R1 在幾乎所有的基準(zhǔn)測(cè)試中性能都優(yōu)于 o1 的硬實(shí)力,再其發(fā)布即開(kāi)源的訓(xùn)練數(shù)據(jù)集和優(yōu)化工具,讓不少網(wǎng)友直呼:這才是真正的 Open AI。
深度賦智 CEO 吳承霖向 雷峰網(wǎng)(公眾號(hào):雷峰網(wǎng))AI 科技評(píng)論評(píng)價(jià): DeepSeek R1 確實(shí)厲害,但方法非常簡(jiǎn)單,核心其實(shí)就三點(diǎn)。
先說(shuō) DeepSeek-R1-Zero,這個(gè)模型完全沒(méi)有使用任何 SFT 數(shù)據(jù),僅通過(guò)純粹的 RL 來(lái)訓(xùn)練模型,突破了以往模型在提升推理能力時(shí)常依賴于 SFT 作為預(yù)訓(xùn)練步驟的形式。這是大模型訓(xùn)練中首次跳過(guò)監(jiān)督微調(diào),是此次DeepSeek的核心創(chuàng)新。
通俗一點(diǎn)講,就是我們不直接告訴模型“應(yīng)該如何解題”,而是讓它通過(guò)自主試錯(cuò)并從中學(xué)習(xí)正確的方法,即 Self play。這就像不讓孩子死記硬背公式,而是直接提供題目和評(píng)分標(biāo)準(zhǔn),讓他們?cè)趯?shí)踐中自行摸索解法。這樣的方式不僅能激發(fā)模型的自主學(xué)習(xí)能力,還可能在探索過(guò)程中發(fā)現(xiàn)更具創(chuàng)新性的思路。

但是DeepSeek-R1-Zero這個(gè)孩子一直做試錯(cuò)練習(xí)的話,就會(huì)有可讀性差和語(yǔ)言混合問(wèn)題。于是團(tuán)隊(duì)研發(fā)推出了 DeepSeek-R1,這個(gè)模型在訓(xùn)練過(guò)程中引入了少量的冷啟動(dòng)數(shù)據(jù),即cold-start data,并通過(guò)多階段 RL 優(yōu)化模型,在僅有極少標(biāo)注數(shù)據(jù)的情況下,極大提升了模型的推理能力。
具體來(lái)說(shuō),冷啟動(dòng)數(shù)據(jù)包含數(shù)千條高質(zhì)量的長(zhǎng)思維鏈(CoT)示例,通過(guò)人工標(biāo)注和格式過(guò)濾(如使用<reasoning>和<summary>標(biāo)簽),強(qiáng)制模型生成結(jié)構(gòu)清晰、語(yǔ)言一致的內(nèi)容。其核心優(yōu)勢(shì)在于:
1、穩(wěn)定性:為強(qiáng)化學(xué)習(xí)(RL)訓(xùn)練提供高質(zhì)量的初始策略,有效避免早期探索階段輸出的混亂無(wú)序,確保訓(xùn)練過(guò)程平穩(wěn)起步。
2、可讀性:借助模板化輸出(如總結(jié)模塊),顯著提升生成內(nèi)容的用戶友好性,使用戶能夠更直觀地理解和接受輸出結(jié)果。

這么說(shuō)吧,雖然孩子做錯(cuò)題集可以有效提高分?jǐn)?shù),但是他的答案可能寫得亂七八糟。通過(guò)先教模型如何規(guī)范地寫步驟和總結(jié),再讓它自由發(fā)揮,最終答案既正確又容易看懂。
除此之外,DeepSeek-R1 Zero還創(chuàng)新了一種很厲害的算法 GRPO,通過(guò)采樣一組輸出并計(jì)算獎(jiǎng)勵(lì)的均值和標(biāo)準(zhǔn)差來(lái)生成優(yōu)勢(shì)函數(shù),從而優(yōu)化策略。這種方法避免了傳統(tǒng) PPO 中需要額外訓(xùn)練價(jià)值模型的高成本,讓模型能夠自主探索復(fù)雜的推理行為,比如長(zhǎng)思維鏈、自我驗(yàn)證和反思。
這種純強(qiáng)化學(xué)習(xí)訓(xùn)練方式在數(shù)學(xué)(AIME 2024 的 Pass@1 從 15.6% 提升至 71.0%)和代碼任務(wù)中取得了顯著提升。簡(jiǎn)單來(lái)說(shuō),就像讓機(jī)器人通過(guò)“試錯(cuò)”學(xué)習(xí)解題,而不是依賴?yán)},最終讓它學(xué)會(huì)了復(fù)雜的解題步驟,表現(xiàn)非常出色。

最后,團(tuán)隊(duì)還分享了他們?cè)趯?shí)驗(yàn)中遇到的很多失敗嘗試,并表示雖然在過(guò)程獎(jiǎng)勵(lì)模型以及蒙特卡洛樹(shù)搜索算法上團(tuán)隊(duì)都沒(méi)有取得研究進(jìn)展,但這并不意味著這些方法無(wú)法開(kāi)發(fā)出有效的推理模型。

值得一提的是, R1 在訓(xùn)練時(shí)甚至還出現(xiàn)了“頓悟時(shí)刻”,就像我們?cè)诮怆y題時(shí)突然“靈光一閃”,模型在訓(xùn)練過(guò)程中也自發(fā)地學(xué)會(huì)了“回頭檢查步驟”。這種能力并非程序員直接教授,而是在算法通過(guò)獎(jiǎng)勵(lì)正確答案的機(jī)制下,自然涌現(xiàn)的。
服務(wù)電話:400-992-1681
服務(wù)郵箱:wa@163.com
公司地址:貴州省貴陽(yáng)市觀山湖區(qū)金融城MAX_A座17樓
備案號(hào):網(wǎng)站地圖
Copyright ? 2021 貴州立即博官網(wǎng)信息技術(shù)有限公司 版權(quán)所有 | 技術(shù)支持:立即博官網(wǎng)
掃描關(guān)注立即博官網(wǎng)信息
掃描關(guān)注立即博官網(wǎng)信息