回上列表
該數據集覆蓋從示教到部署的各個階段,專家示教提供任務的標準示範;人類在環糾正軌跡記錄模型執行犯錯時人類的接管與糾正;部署推理軌跡(Rollout)則有模型真實部署執行產生的成功與失敗。在此基礎上,數據集進一步標註進度、錯誤、成功與干擾等關鍵信息。研究者可以據此訓練不同維度的獎勵模型(Reward Model),將軌跡級的成敗結果細化為過程反饋,為真機強化學習的研究提供可覆用的數據基礎。(jl/u)~
阿思達克財經新聞
網址: www.aastocks.com
智元開源AGIBOT WORLD第三期強化學習數據集 首批開放逾1.1萬條交互軌跡
2026/09/01 12:43
智元發布AGIBOT WORLD 2026第三期開源強化學習數據集,本期數據集首批開源數據覆蓋11,430條軌跡,包括1,024條成功Rollout軌跡、1,369條失敗Rollout軌跡,並提供豐富的細粒度標註。該數據集覆蓋從示教到部署的各個階段,專家示教提供任務的標準示範;人類在環糾正軌跡記錄模型執行犯錯時人類的接管與糾正;部署推理軌跡(Rollout)則有模型真實部署執行產生的成功與失敗。在此基礎上,數據集進一步標註進度、錯誤、成功與干擾等關鍵信息。研究者可以據此訓練不同維度的獎勵模型(Reward Model),將軌跡級的成敗結果細化為過程反饋,為真機強化學習的研究提供可覆用的數據基礎。(jl/u)~
阿思達克財經新聞
網址: www.aastocks.com
![]() |

