午夜在线-午夜视频网站-日韩城人网站-娇妻被邀上台玩多p-国产美女久久久-黄色免费观看网站-黄色片91-男女视频免费观看-久久瑟瑟-华人在线视频-人妻少妇精品无码专区久久-爆操白丝美女-国产免费一级视频-中文字幕 自拍偷拍-精品国产一区二区三区四区精华-青青草久-黄色精品视频在线观看-福利片网址-精品熟女一区二区-黄污下载-国产美女免费观看-久久久久久久久艹-好吊妞一区二区三区-蜜臀一区二区三区精品免费视频-蜜桃视频免费网站-91视频黄污-日韩成人视屏-黄网站视频免费-亚洲精品国产精品乱码不99热-久久中文字幕国产

?
快捷導(dǎo)航
ai動(dòng)態(tài)
DeepSeek-R1 最新發(fā)布,劍指 OpenAI o1



  而這次的 R1 模型一出,不僅反駁了之前蒸餾 OpenAI o1 的說(shuō)法,官方更是直接下場(chǎng)表示:

  值得一提的是, R1 突破了以往的模型訓(xùn)練形式,完全沒(méi)有使用任何 SFT 數(shù)據(jù),僅通過(guò)純粹的 RL 來(lái)訓(xùn)練模型,這一點(diǎn)說(shuō)明 R1 已經(jīng)學(xué)會(huì)了自己思考問(wèn)題——這實(shí)則更符合人類的思維規(guī)則。

  并且在數(shù)學(xué)、代碼、自然語(yǔ)言推理上更是和 o1 正式版不相上下,在多個(gè)基準(zhǔn)測(cè)試中展現(xiàn)了卓越的性能。

  如果你仍未真切領(lǐng)略到它的強(qiáng)大,那么請(qǐng)注意:它只需付出 o1 五十分之一的成本,卻能收獲 o1 百分之百的效能。

  除了 R1 在幾乎所有的基準(zhǔn)測(cè)試中性能都優(yōu)于 o1 的硬實(shí)力,再其發(fā)布即開(kāi)源的訓(xùn)練數(shù)據(jù)集和優(yōu)化工具,讓不少網(wǎng)友直呼:這才是真正的 Open AI。

  深度賦智 CEO 吳承霖向 雷峰網(wǎng)(公眾號(hào):雷峰網(wǎng))AI 科技評(píng)論評(píng)價(jià): DeepSeek R1 確實(shí)厲害,但方法非常簡(jiǎn)單,核心其實(shí)就三點(diǎn)。

  先說(shuō) DeepSeek-R1-Zero,這個(gè)模型完全沒(méi)有使用任何 SFT 數(shù)據(jù),僅通過(guò)純粹的 RL 來(lái)訓(xùn)練模型,突破了以往模型在提升推理能力時(shí)常依賴于 SFT 作為預(yù)訓(xùn)練步驟的形式。這是大模型訓(xùn)練中首次跳過(guò)監(jiān)督微調(diào),是此次DeepSeek的核心創(chuàng)新。

  通俗一點(diǎn)講,就是我們不直接告訴模型“應(yīng)該如何解題”,而是讓它通過(guò)自主試錯(cuò)并從中學(xué)習(xí)正確的方法,即 Self play。這就像不讓孩子死記硬背公式,而是直接提供題目和評(píng)分標(biāo)準(zhǔn),讓他們?cè)趯?shí)踐中自行摸索解法。這樣的方式不僅能激發(fā)模型的自主學(xué)習(xí)能力,還可能在探索過(guò)程中發(fā)現(xiàn)更具創(chuàng)新性的思路。

  但是DeepSeek-R1-Zero這個(gè)孩子一直做試錯(cuò)練習(xí)的話,就會(huì)有可讀性差和語(yǔ)言混合問(wèn)題。于是團(tuán)隊(duì)研發(fā)推出了 DeepSeek-R1,這個(gè)模型在訓(xùn)練過(guò)程中引入了少量的冷啟動(dòng)數(shù)據(jù),即cold-start data,并通過(guò)多階段 RL 優(yōu)化模型,在僅有極少標(biāo)注數(shù)據(jù)的情況下,極大提升了模型的推理能力。

  具體來(lái)說(shuō),冷啟動(dòng)數(shù)據(jù)包含數(shù)千條高質(zhì)量的長(zhǎng)思維鏈(CoT)示例,通過(guò)人工標(biāo)注和格式過(guò)濾(如使用<reasoning>和<summary>標(biāo)簽),強(qiáng)制模型生成結(jié)構(gòu)清晰、語(yǔ)言一致的內(nèi)容。其核心優(yōu)勢(shì)在于:

  1、穩(wěn)定性:為強(qiáng)化學(xué)習(xí)(RL)訓(xùn)練提供高質(zhì)量的初始策略,有效避免早期探索階段輸出的混亂無(wú)序,確保訓(xùn)練過(guò)程平穩(wěn)起步。

  2、可讀性:借助模板化輸出(如總結(jié)模塊),顯著提升生成內(nèi)容的用戶友好性,使用戶能夠更直觀地理解和接受輸出結(jié)果。

  這么說(shuō)吧,雖然孩子做錯(cuò)題集可以有效提高分?jǐn)?shù),但是他的答案可能寫得亂七八糟。通過(guò)先教模型如何規(guī)范地寫步驟和總結(jié),再讓它自由發(fā)揮,最終答案既正確又容易看懂。

  除此之外,DeepSeek-R1 Zero還創(chuàng)新了一種很厲害的算法 GRPO,通過(guò)采樣一組輸出并計(jì)算獎(jiǎng)勵(lì)的均值和標(biāo)準(zhǔn)差來(lái)生成優(yōu)勢(shì)函數(shù),從而優(yōu)化策略。這種方法避免了傳統(tǒng) PPO 中需要額外訓(xùn)練價(jià)值模型的高成本,讓模型能夠自主探索復(fù)雜的推理行為,比如長(zhǎng)思維鏈、自我驗(yàn)證和反思。

  這種純強(qiáng)化學(xué)習(xí)訓(xùn)練方式在數(shù)學(xué)(AIME 2024 的 Pass@1 從 15.6% 提升至 71.0%)和代碼任務(wù)中取得了顯著提升。簡(jiǎn)單來(lái)說(shuō),就像讓機(jī)器人通過(guò)“試錯(cuò)”學(xué)習(xí)解題,而不是依賴?yán)},最終讓它學(xué)會(huì)了復(fù)雜的解題步驟,表現(xiàn)非常出色。

  最后,團(tuán)隊(duì)還分享了他們?cè)趯?shí)驗(yàn)中遇到的很多失敗嘗試,并表示雖然在過(guò)程獎(jiǎng)勵(lì)模型以及蒙特卡洛樹(shù)搜索算法上團(tuán)隊(duì)都沒(méi)有取得研究進(jìn)展,但這并不意味著這些方法無(wú)法開(kāi)發(fā)出有效的推理模型。

  值得一提的是, R1 在訓(xùn)練時(shí)甚至還出現(xiàn)了“頓悟時(shí)刻”,就像我們?cè)诮怆y題時(shí)突然“靈光一閃”,模型在訓(xùn)練過(guò)程中也自發(fā)地學(xué)會(huì)了“回頭檢查步驟”。這種能力并非程序員直接教授,而是在算法通過(guò)獎(jiǎng)勵(lì)正確答案的機(jī)制下,自然涌現(xiàn)的。



 

上一篇:中傳聯(lián)合新浪發(fā)布《中國(guó)智能媒體發(fā)展報(bào)告》 展
下一篇:GPT未竟的革命,由o1接棒:或是LLM研究最重要的發(fā)
?

服務(wù)電話:400-992-1681

服務(wù)郵箱:wa@163.com

公司地址:貴州省貴陽(yáng)市觀山湖區(qū)金融城MAX_A座17樓

備案號(hào):網(wǎng)站地圖

Copyright ? 2021 貴州立即博官網(wǎng)信息技術(shù)有限公司 版權(quán)所有 | 技術(shù)支持:立即博官網(wǎng)

  • 掃描關(guān)注立即博官網(wǎng)信息

  • 掃描關(guān)注立即博官網(wǎng)信息