】 【打 印】 
“強化學習之父”薩頓宣布創業,向LLM範式宣戰
http://www.CRNTT.com   2026-07-14 22:14:17
這位69歲的圖靈獎得主直言,當前的深度學習方法存在底層邏輯上的根本缺陷,需要的不是修修補補,而是推倒重來的範式革命。“Oak Lab將走一條不同的道路。”(視頻截圖)
  中評社香港7月14日電(記者 肖瑞)“強化學習之父”理查德·薩頓(Richard Sutton)7月13日在社交平台X上宣布辭職創業。他與合作者Khurram Javed共同創立Oak Lab新公司,將致力於打造一種完全不同於當前大語言模型的AI系統--一個能夠從自身經驗中持續學習、實時進化的智能體。

  這位69歲的圖靈獎得主在發帖中直言,當前的深度學習方法存在底層邏輯上的根本缺陷,需要的不是修修補補,而是推倒重來的範式革命。“Oak Lab將走一條不同的道路。”

  薩頓是強化學習理論的奠基人,他與導師安德魯·巴托(Andrew Barto)因在該領域的開創性貢獻獲得2024年度ACM圖靈獎(2025年3月公布),其合著的《強化學習導論》被視為該領域的標準教科書,AlphaGo的核心設計者David Silver正是他的學生。

  規模盛大的2026世界人工智能大會(WAIC)將於7月17日在上海召開,薩頓將以WAIC Academic國際聯席主席的身份,與圖靈獎得主姚期智共同主持這一首次設立的高水平學術會議,並定於7月19日在"思想者論壇"發表專場演講,首次系統闡述Oak Lab的OaK技術架構與"去LLM化"的技術路線。

  在矽谷巨頭主導大模型(LLM)範式的當下,薩頓選擇在中國最具行業風向標意義的AI舞台上,為非主流技術路徑發聲。這一舉動,其象徵意義已然超越了單純的學術流派之爭。

  薩頓的批評直指當前AI產業的核心邏輯,他認為當前的大語言模型本質上仍是在"搬運人類已有的知識",雖然擅長模仿人類的表達,但並不具備在運行過程中持續學習的能力。一個訓練完成的模型在部署之後就停止了學習,無法從與用戶的交互中獲取真正的新知識,也無法評估自身輸出的正確性。

  薩頓認為,真正的智能必須像 AlphaZero("Zero"(指零人類知識、純靠自我對弈從零學起)那樣,通過試錯和自我對弈產生新的發現,而非僅僅模仿人類表達。

  當前深度學習系統在持續學習中面臨兩個根深蒂固的難題:一個是災難性遺忘,新學到的信息會覆蓋已有知識;另一個是可塑性喪失,系統在學習一段時間後逐漸失去繼續學習新事物的能力。

  因此,薩頓在多個場合表示,持續學習的核心難題尚未解決,是他還無法展示大規模新架構系統實例的原因。他承認,Oak Lab的成立更像是一個長期的科學賭注,而非短期的商業機會。

  他的批評者指出,強化學習在圍棋、國際象棋等有明確勝負規則的封閉領域取得了出色成果,但在開放式的現實世界環境中,獎勵信號往往模糊不清,純粹的強化學習面臨巨大挑戰。

  此外,當前AI在推理和數學方面的許多進步恰恰來自將強化學習與大語言模型相結合的方法,兩條路線是否必須對立,仍是一個開放問題。

  對於投資者而言,薩頓的創業提供了一個觀察窗口:AI產業是否可能正從"數據規模驅動"的第一階段,轉向"學習機制驅動"的第二階段,雖然這一轉變的時間表極不確定。

  薩頓的賭注能否兌現,尚無定論。但在數千億美元湧入大模型賽道的今天,另一種關於智能本質的思考,自有其不可替代的價值。

掃描二維碼訪問中評網移動版 】 【打 印掃描二維碼訪問中評社微信  

 相關新聞: