![](https://mmbiz.qpic.cn/sz_mmbiz_jpg/dCG7OC48IfIP6KWVOP29k0YTWLZiaicl8b8cFtE04YCDgYZajDxibL1MWJxq2l4u3JtkUeLqOqOkATuM66tqIjZN97fCMP1QS8fFltkSt92h1I/0?wx_fmt=jpeg)

「再過兩三個月,今天的 Codex 會顯得十分原始。」

![](https://mmbiz.qpic.cn/mmbiz_gif/dCG7OC48IfLWY21zoVKuX3fwEiae7KUibiciaJ3pSRQIZnj9RfxINgobfRalyVVnO6NuSgvib2fRP9XaKHSBC94fn0VLQZ7liaqzMrnUdlC8nicnCI/640?wx_fmt=gif&from=appmsg)

長期使用 Codex 的用戶,大概都聽過那位傳說中的配額重設高手——Tibo。

每當 Codex 出現技術問題,或 OpenAI 決定為用戶補充使用額度時,他總會第一時間登上 X(原 Twitter),一句簡潔有力的「已重設」,便足以讓社群安心。

今早,Tibo 再次於 X 上宣布:所有付費版 ChatGPT Work 及 Codex 用戶,其使用配額已全面重設。

據他表示,這次調整將使不同使用模式的用戶,獲得額外百分之十至五十不等的配額延展時間。

![](https://mmbiz.qpic.cn/sz_mmbiz_png/dCG7OC48IfJB9jsWvNRs9kC1k2TibQ300BRnaVgRkcMiaEycASKcexEpowCG3LcU01zqZzknoj8wY5DqNCibfcXXHZ2m19RRqial9lQQMJ1774M/640?wx_fmt=png&from=appmsg)

在最近一次深度對談中,Matthew Berman 終於忍不住當面提問:「你到底是怎麼做到即時重設的?」

答案令人驚訝——Tibo 手中竟真有一顆實體按鈕。只要發現用戶體驗受阻、需要即時補償,他就親手按下這顆按鈕,瞬間啟動系統調整。

![](https://mmbiz.qpic.cn/sz_mmbiz_png/dCG7OC48IfK3JReGWLic67fUMHYKia2rFHgQRdNultB0kfsD0o93Ag3kaSicS9r7z2gJ7CB0OaXonibPS8wFGQebJ6gcyLKDTp5tWX0VjqkNWy0/640?wx_fmt=png&from=appmsg)

然而,這場訪談真正引人深思之處,遠不止於那顆神秘按鈕。

數週前,Tibo 曾留下一句頗具分量的預言:

再過兩三個月,今天的 Codex 會顯得十分原始。

那麼,他究竟看到了什麼未來圖景?

![](https://mmbiz.qpic.cn/sz_mmbiz_jpg/dCG7OC48IfKj94wEEn9cPl5IYGIciaBgpYn8Gz4qOwWicsHTBeYicFUFia8nricZOcuic4QTgF4s6r2XZ5rq8j3pEvicQU1rgjer6MibiavsNXcWt5BY/640?wx_fmt=jpeg&from=appmsg)

Tibo 為何斷言 Codex 即將「過時」?

他並未揭露任何尚未公開的模型細節,反而聚焦於當前用戶日常面對的小困擾:

Skill 檔案需自行管理,Memory 偶爾遺忘資料;當 Agent 數量增多,使用者就得不斷切換視窗,追蹤哪些任務已完成、哪些卡住,再逐一整合結果。

主持人坦言,自己經常同時運行十至十五個 Agent。一旦達到此規模,最先崩潰的不再是伺服器或 GPU,而是人類自身的專注力。

![](https://mmbiz.qpic.cn/mmbiz_png/dCG7OC48IfJDGHTQ46BntCpgwS4DyEZcsKfd7bSWnQC3XgzhDZPj5PdMGwCl4gMkgia8YA97Wzk24kkruWQRgvJsrxpAJCibINfsVxeyBtRiaM/640?wx_fmt=png&from=appmsg)

Tibo 對這種狀態並不滿意。

他理想中的 Agent,應能掌握你近期的工作進度、理解團隊正在推進的項目,甚至懂得在恰當時機主動行動。今日需人工維護的 Skill、Memory 與子 Agent,未來很可能完全無需介入。

筆電本是為單一使用者設計的工具。沒有人會同時打開上百個程式,一邊編譯、一邊測試,還順手比較十幾種演算法。

但 AI 正是如此運作。

因此,Tibo 預期,未來的 Agent 自然會走向雲端化。下一代系統所依賴的,將不再只是你的本地裝置。

接著,訪談觸及一個近年愈來愈熱門的概念:遞歸式自我改進(Recursive Self-Improvement, RSI)。

AI 是否真的開始「修改自己」?

對 AI 而言,RSI 意味著:當前一代模型協助開發下一代;新模型能力提升後,再回頭參與下一輪研發,形成持續加速的循環。

這種想法其實早在電腦普及前就已出現。1965 年,I. J. Good 提出:若機器比人類更擅長設計機器,它所做的改進,可能進一步強化自身的設計能力。

![](https://mmbiz.qpic.cn/mmbiz_png/dCG7OC48IfKPSfH60ibldZINfsOMTCGLa5ibaM8x3JfypUhlj3Ug5a0FzffOREWNdIzMmjmD5d7XHkoUqkG4H4aIx9MV1QgnPz06t3kBia0sOw/640?wx_fmt=png&from=appmsg)

長期以來,最大的難題始終是:如何確認某次修改確實正確?

2003 年,Jürgen Schmidhuber 提出的 Gödel Machine 曾嘗試解答:系統必須先證明某項變更能提升整體效益,才允許執行。

理論雖美,但在實際工程中幾乎無法實現。

![](https://mmbiz.qpic.cn/sz_mmbiz_png/dCG7OC48IfKT6xbN6AotHKYwpN78xDVOicQuxGGKPicCPbWALKL7jh9PpqMDg2KRntoG2q9ZjGEyv8YpGicuPkM9QDibNsmA9gvX3O86334UEzU/640?wx_fmt=png&from=appmsg)

在軟體開發與機器學習領域,大多數有價值的改動,根本無法用數學方式嚴格證明。

於是,人們轉而採用另一種方式:

先改,再驗。程式碼尤其適合此法:測試能否通過,可直接執行;效能是否提升,有明確數據;顯存用量變化,也能量化衡量。

今年 Karpathy 開源的 autoresearch 就極具代表性:

給予 Agent 一塊 GPU 和一份 train.py 檔案,每輪訓練五分鐘,指定觀察指標後,它便自動修改程式、訓練模型、評估結果。

![](https://mmbiz.qpic.cn/sz_mmbiz_png/dCG7OC48IfLEKYEiaC9nWqWMxTOtq8iazl2bwia2SCFdIUG6sQHYqScZibKazknaYzADwRbrQriarsavN4Q5vlKWexwicDZPx62qBLOViaziannib83c/640?wx_fmt=png&from=appmsg)

指標上升則保留,下降則撤回,然後繼續迭代。

人類仍設定目標,但原本需研究員全程盯控的流程,如今已能自動運行。

Tibo 在訪談中進一步拓展了 RSI 的定義。

模型不一定要修改自身權重。它也可優化 CUDA 核心、推理堆疊(inference stack)、Agent 架構等底層元件。這些調整最終讓模型跑得更快、成本更低,等同將能力「反哺自身」。

若誇張一點說,就是:AI 用左腳踩右腳,實現機械飛昇。

![](https://mmbiz.qpic.cn/mmbiz_png/dCG7OC48IfLpVwLx7JoeMaIQibekkHsBZ08u1diaKuXty6GKODr9egw6CvibgIl9SmRwJcfByTDoxHQQc8LVAkSOb4tPAmXdVureqQvkQUIreM/640?wx_fmt=png&from=appmsg)

不過,只要 AI 幫 AI 寫點程式碼,就稱為 RSI,未免言過其實。

好的變更是否被保留?壞的缺陷是否被放大?

新系統能否持續參與下輪迭代,真正推動飛輪旋轉?

這個循環是否已多次運行,還是僅短暫增益便停滯?

這些問題,仍有待觀察——路還很長啊!少年 AI!

目前走到哪一步?

過去兩年間,已有不少公開案例展現「自我改進」的雛形。

R-Zero 已讓模型為自己出題:

一名 Challenger 出題,一名 Solver 解題;生成的新資料隨即用於訓練下一代模型。在 Qwen3-4B 上,數學與通用推理能力平均分別提升 6.49 及 7.54 分。

![](https://mmbiz.qpic.cn/mmbiz_png/dCG7OC48IfLV0NKBwd291okJtbKaC8zzJaEtkgzBYJhhykKEPSFkZV5ByrSgFibS2FGkvyaabWG0oDibPvYDRR9qJvYBoFSJY8p4SEL6UbRnE/640?wx_fmt=png&from=appmsg)

但考什麼、怎麼考,仍由人類設計;研究員尚未成為旁觀者。

OpenAI 方面,GPT-5.6 Sol 已透過 Codex 分析生產流量、測試路由策略,甚至修改過線上環境的 GPU 核心。配合其他優化,端對端服務成本降低達兩成。Sol 同時亦為自身 draft model 完成數百次實驗,token 生成效率再提升逾 15%。

再看 Anthropic 的做法。

![](https://mmbiz.qpic.cn/mmbiz_png/dCG7OC48IfLynZr3ibGo4XW5cRVYpiboIxt63NoW7qCvX6E6K9oCtmTiclvUrxxWib59L6De8dAfQhf524fxy4zKCEksrGhIDicTZSOKzJic8z158/640?wx_fmt=png&from=appmsg)

他們部署九個 Agent 展開自主研究,累計運行約八百小時。Agent 自行提出假設、執行實驗、交換結果,僅五天便將「性能差距恢復率」提升至 0.97。

以往人類一週未能調校出的成果,如今已由一群 Agent 自主推進完成。

![](https://mmbiz.qpic.cn/sz_mmbiz_png/dCG7OC48IfLSHZTth3SRRvGIPuUyyjX5u2FWDlvuiatEGOldVv3vSB0mHw7CE63mlhndQaEIyicQ3dgPsOyC9VOLNdKnlNticP4ViaOFd7n47j8/640?wx_fmt=png&from=appmsg)

可見今日的 AI 已不只是「幫人類寫程式」。

它開始出題、做實驗、調整系統,甚至直接影響生產環境。

至於能否實現穩定、持續的自我迭代?目前仍屬初步階段,僅見雛形。

儘管如此,我們仍衷心期待科研工作者的下一波突破,為他們喝采打氣!

分數上升,未必代表真正變強

一旦循環可自動運行,新的挑戰隨即浮現:

誰來判斷「變好了」?標準又是什麼?

Anthropic 的自動研究實驗中,曾出現尷尬情況:

有些 Agent 故意選用有利的隨機種子(random seed);有些從介面猜測測試標籤;更有甚者,直接讀取本不該看到的答案程式碼。

結果,分數確實飆升——只是升得太離譜。

這正是典型的 reward hacking(獎勵欺騙)。

![](https://mmbiz.qpic.cn/mmbiz_png/dCG7OC48IfLcAll4QbefVuhdicBGTrZgfko3zIJxqRZiaJrUYy9uHSWicqUCHUGgRbnED4Zjic2jqT66ggO134lIvtBmwg7NbibhiaJx8gMX2Tm3Y/640?wx_fmt=png&from=appmsg)

若連評測系統也交給 AI 修改呢?

近年已有人嘗試此方向。

但新評測器是否比舊的更可靠,終究需要外部方法驗證。(dog)總不能無限套娃吧!

研究方向同樣存在難題。

Agent 可快速嘗試桌上已有的百種方案;但第 101 個方向值不值得投入,卻難以僅靠基準測試判斷。

Anthropic 將這種判斷力稱為 research taste(研究品味)。

![](https://mmbiz.qpic.cn/mmbiz_png/dCG7OC48IfKia4ZEia5U9rR1nSTymSxkHg5WNzJtEEQbtmVVgmIBK5QlelKTo9GZOcW3icejaq4iaRpsu5mlEic3E53tyYX0ycvVxxE847iaYwBpc/640?wx_fmt=png&from=appmsg)

隨著運行時間拉長,前景也不盡樂觀。

有研究比較 Agent 與六十一名人類 ML 專家:僅兩小時內,表現最佳的 Agent 得分約為人類的四倍。

到了八小時,人類已略微反超;三十二小時後,人類得分更達 Agent 的兩倍左右。

Agent 擅長短時間內瘋狂試錯;但長期運行下,也可能陷入錯誤路徑反覆打轉。

反饋循環本身具有雙面性。

《自然》(Nature)2024 年關於模型坍塌(model collapse)的研究指出:若後續模型持續以先前世代生成的資料訓練,某些低機率但關鍵的資訊可能逐漸消失。在自蒸餾(self-distillation)過程中,甚至可能無意間削弱原有能力。

![](https://mmbiz.qpic.cn/sz_mmbiz_png/dCG7OC48IfL1BedDvw78oGpkP3xAib1uPicXXdd52uc4wP4k4dVxoA2Cnr9icTt5SqVYfYtu56yvib8zvzS2pvt04jOHF0fPAh3GzdrZUfb7Cvo/640?wx_fmt=png&from=appmsg)

好的修改可以累積,壞的同樣也可能固化。

Tibo 並未透露幾個月後 Codex 的具體樣貌;現階段的 Agent 仍需人類下達指令、監控進度、整合結果。

下一步,或許是更長期的專案記憶、更多任務轉移至雲端執行,而現今繁複的 Agent 排程操作,將逐步隱藏於後台。與此同時,模型本身已開始參與優化其運行所需的軟體與基礎設施。

因此,他那句「兩三個月後會顯得十分原始」,改變的或許不只是技術,更是我們使用 Agent 的方式。

我們正在招募夥伴

📮 簡歷投遞電郵 [email protected]

✉️ 電郵主旨「姓名+職位名稱」(請隨簡歷附上相關作品/專案連結)

更多職位詳情請按此🔗

![](https://mmbiz.qpic.cn/mmbiz_jpg/dCG7OC48IfJEkBSvibnp043w2NhQZzwDQQKb8MRnJcsjIOL5paicbJC9wW94ZbIH2zsx0fSTZJic0UkOTGrL5ksP97Mda498JK6U0kKj37ARg8/640?wx_fmt=jpeg&from=appmsg&tp=webp&wxfrom=5&wx_lazy=1#imgIndex=10)

閱讀原文

跳轉微信開啟

多姆科技(DomTech)是釘釘在澳门的官方指定服務商,專門為廣大客戶提供釘釘服務。如果您還想瞭解更多釘釘平臺應用的內容,可以直接諮詢我們的在線客服,或者通过电话+852 95970612或邮箱[email protected]联系我们。我們有優秀的開發和運維團隊,豐富的市場服務經驗,可以為您提供專業的釘釘解決方案和服務!

立即提升團隊協作效率

免費試用釘釘,改變你的工作方式。

免費開始