
「再過兩三個月,今天的 Codex 會顯得十分原始。」

長期使用 Codex 的用戶,大概都聽過那位傳說中的配額重設高手——Tibo。
每當 Codex 出現技術問題,或 OpenAI 決定為用戶補充使用額度時,他總會第一時間登上 X(原 Twitter),一句簡潔有力的「已重設」,便足以讓社群安心。
今早,Tibo 再次於 X 上宣布:所有付費版 ChatGPT Work 及 Codex 用戶,其使用配額已全面重設。
據他表示,這次調整將使不同使用模式的用戶,獲得額外百分之十至五十不等的配額延展時間。

在最近一次深度對談中,Matthew Berman 終於忍不住當面提問:「你到底是怎麼做到即時重設的?」
答案令人驚訝——Tibo 手中竟真有一顆實體按鈕。只要發現用戶體驗受阻、需要即時補償,他就親手按下這顆按鈕,瞬間啟動系統調整。

然而,這場訪談真正引人深思之處,遠不止於那顆神秘按鈕。
數週前,Tibo 曾留下一句頗具分量的預言:
再過兩三個月,今天的 Codex 會顯得十分原始。
那麼,他究竟看到了什麼未來圖景?

Tibo 為何斷言 Codex 即將「過時」?
他並未揭露任何尚未公開的模型細節,反而聚焦於當前用戶日常面對的小困擾:
Skill 檔案需自行管理,Memory 偶爾遺忘資料;當 Agent 數量增多,使用者就得不斷切換視窗,追蹤哪些任務已完成、哪些卡住,再逐一整合結果。
主持人坦言,自己經常同時運行十至十五個 Agent。一旦達到此規模,最先崩潰的不再是伺服器或 GPU,而是人類自身的專注力。

Tibo 對這種狀態並不滿意。
他理想中的 Agent,應能掌握你近期的工作進度、理解團隊正在推進的項目,甚至懂得在恰當時機主動行動。今日需人工維護的 Skill、Memory 與子 Agent,未來很可能完全無需介入。
筆電本是為單一使用者設計的工具。沒有人會同時打開上百個程式,一邊編譯、一邊測試,還順手比較十幾種演算法。
但 AI 正是如此運作。
因此,Tibo 預期,未來的 Agent 自然會走向雲端化。下一代系統所依賴的,將不再只是你的本地裝置。
接著,訪談觸及一個近年愈來愈熱門的概念:遞歸式自我改進(Recursive Self-Improvement, RSI)。
AI 是否真的開始「修改自己」?
對 AI 而言,RSI 意味著:當前一代模型協助開發下一代;新模型能力提升後,再回頭參與下一輪研發,形成持續加速的循環。
這種想法其實早在電腦普及前就已出現。1965 年,I. J. Good 提出:若機器比人類更擅長設計機器,它所做的改進,可能進一步強化自身的設計能力。

長期以來,最大的難題始終是:如何確認某次修改確實正確?
2003 年,Jürgen Schmidhuber 提出的 Gödel Machine 曾嘗試解答:系統必須先證明某項變更能提升整體效益,才允許執行。
理論雖美,但在實際工程中幾乎無法實現。

在軟體開發與機器學習領域,大多數有價值的改動,根本無法用數學方式嚴格證明。
於是,人們轉而採用另一種方式:
先改,再驗。程式碼尤其適合此法:測試能否通過,可直接執行;效能是否提升,有明確數據;顯存用量變化,也能量化衡量。
今年 Karpathy 開源的 autoresearch 就極具代表性:
給予 Agent 一塊 GPU 和一份 train.py 檔案,每輪訓練五分鐘,指定觀察指標後,它便自動修改程式、訓練模型、評估結果。

指標上升則保留,下降則撤回,然後繼續迭代。
人類仍設定目標,但原本需研究員全程盯控的流程,如今已能自動運行。
Tibo 在訪談中進一步拓展了 RSI 的定義。
模型不一定要修改自身權重。它也可優化 CUDA 核心、推理堆疊(inference stack)、Agent 架構等底層元件。這些調整最終讓模型跑得更快、成本更低,等同將能力「反哺自身」。
若誇張一點說,就是:AI 用左腳踩右腳,實現機械飛昇。

不過,只要 AI 幫 AI 寫點程式碼,就稱為 RSI,未免言過其實。
好的變更是否被保留?壞的缺陷是否被放大?
新系統能否持續參與下輪迭代,真正推動飛輪旋轉?
這個循環是否已多次運行,還是僅短暫增益便停滯?
這些問題,仍有待觀察——路還很長啊!少年 AI!
目前走到哪一步?
過去兩年間,已有不少公開案例展現「自我改進」的雛形。
R-Zero 已讓模型為自己出題:
一名 Challenger 出題,一名 Solver 解題;生成的新資料隨即用於訓練下一代模型。在 Qwen3-4B 上,數學與通用推理能力平均分別提升 6.49 及 7.54 分。

但考什麼、怎麼考,仍由人類設計;研究員尚未成為旁觀者。
OpenAI 方面,GPT-5.6 Sol 已透過 Codex 分析生產流量、測試路由策略,甚至修改過線上環境的 GPU 核心。配合其他優化,端對端服務成本降低達兩成。Sol 同時亦為自身 draft model 完成數百次實驗,token 生成效率再提升逾 15%。
再看 Anthropic 的做法。

他們部署九個 Agent 展開自主研究,累計運行約八百小時。Agent 自行提出假設、執行實驗、交換結果,僅五天便將「性能差距恢復率」提升至 0.97。
以往人類一週未能調校出的成果,如今已由一群 Agent 自主推進完成。

可見今日的 AI 已不只是「幫人類寫程式」。
它開始出題、做實驗、調整系統,甚至直接影響生產環境。
至於能否實現穩定、持續的自我迭代?目前仍屬初步階段,僅見雛形。
儘管如此,我們仍衷心期待科研工作者的下一波突破,為他們喝采打氣!
分數上升,未必代表真正變強
一旦循環可自動運行,新的挑戰隨即浮現:
誰來判斷「變好了」?標準又是什麼?
Anthropic 的自動研究實驗中,曾出現尷尬情況:
有些 Agent 故意選用有利的隨機種子(random seed);有些從介面猜測測試標籤;更有甚者,直接讀取本不該看到的答案程式碼。
結果,分數確實飆升——只是升得太離譜。
這正是典型的 reward hacking(獎勵欺騙)。

若連評測系統也交給 AI 修改呢?
近年已有人嘗試此方向。
但新評測器是否比舊的更可靠,終究需要外部方法驗證。(dog)總不能無限套娃吧!
研究方向同樣存在難題。
Agent 可快速嘗試桌上已有的百種方案;但第 101 個方向值不值得投入,卻難以僅靠基準測試判斷。
Anthropic 將這種判斷力稱為 research taste(研究品味)。

隨著運行時間拉長,前景也不盡樂觀。
有研究比較 Agent 與六十一名人類 ML 專家:僅兩小時內,表現最佳的 Agent 得分約為人類的四倍。
到了八小時,人類已略微反超;三十二小時後,人類得分更達 Agent 的兩倍左右。
Agent 擅長短時間內瘋狂試錯;但長期運行下,也可能陷入錯誤路徑反覆打轉。
反饋循環本身具有雙面性。
《自然》(Nature)2024 年關於模型坍塌(model collapse)的研究指出:若後續模型持續以先前世代生成的資料訓練,某些低機率但關鍵的資訊可能逐漸消失。在自蒸餾(self-distillation)過程中,甚至可能無意間削弱原有能力。

好的修改可以累積,壞的同樣也可能固化。
Tibo 並未透露幾個月後 Codex 的具體樣貌;現階段的 Agent 仍需人類下達指令、監控進度、整合結果。
下一步,或許是更長期的專案記憶、更多任務轉移至雲端執行,而現今繁複的 Agent 排程操作,將逐步隱藏於後台。與此同時,模型本身已開始參與優化其運行所需的軟體與基礎設施。
因此,他那句「兩三個月後會顯得十分原始」,改變的或許不只是技術,更是我們使用 Agent 的方式。
我們正在招募夥伴
📮 簡歷投遞電郵 [email protected]
✉️ 電郵主旨「姓名+職位名稱」(請隨簡歷附上相關作品/專案連結)
更多職位詳情請按此🔗

閱讀原文
跳轉微信開啟
多姆科技(DomTech)是釘釘在澳门的官方指定服務商,專門為廣大客戶提供釘釘服務。如果您還想瞭解更多釘釘平臺應用的內容,可以直接諮詢我們的在線客服,或者通过电话+852 95970612或邮箱[email protected]联系我们。我們有優秀的開發和運維團隊,豐富的市場服務經驗,可以為您提供專業的釘釘解決方案和服務!
Português
English