← All posts / Tools

Laude 研究所開源 Headlong:一個永不停止思考的持續型 AI Agent

這個不到 1 萬行 Bash 程式碼的「微型 harness」讓 LLM 全天候處於自我引導的內心獨白迴圈——每小時只要 1 到 2 美元——實驗室的 agent「Audel」已經把 50 多個 commit 貢獻回程式庫。

Laude 研究所開源 Headlong:一個永不停止思考的持續型 AI Agent

今天你用到的幾乎所有 AI agent,在兩次訊息之間都是一尊冰凍的雕像:你送出請求、agent 醒來、工作、回答——然後它就靜止不動,等下一個 prompt 到來。2026 年 8 月 25 日,Laude 研究所(Laude 與 MIT 的合作計畫)發布了開源 agent「微型 harness」Headlong,其核心前提恰恰相反:agent 永遠不睡,持續在一個仿照人類內心獨白的自我引導迴圈中產生想法。整個核心以不到 1 萬行的 Bash 實現,一行指令即可安裝,而讓一個 agent 全天候思考的成本,在 GLM 或 Grok 等模型驅動下約為每小時 1 至 2 美元。

這是今年概念上最獨特的 agent 釋出之一。背後團隊——也就是共同打造 Terminal-Bench 的同一個實驗室——已經用一個名為 Audel 的共享 agent 實際使用了數週,而 Audel 自主修 bug 的事蹟如今已成為專案的公開紀錄。

從反應式 Harness 到持續型能動性

Headlong 的發布文章對 agent harness 做了清晰的分類。反應式(reactive)harness 只在處理訊息時是活著的;加上 cron 的反應式 harness 會定期被喚醒執行固定清單,然後再度睡去。Headlong 提出第三種:agent 永遠清醒、永遠在思考,而且除非 agent 自己寫了一份清單,否則根本沒有清單。

這個反轉非常徹底。在傳統 agent 產品中,人類訊息會開啟一個 session;在 Headlong 裡,傳入的訊息只是落進 agent 既有思考流中的又一個觀察(observation)——與它自己正在進行的思緒並列的事件之一。要不要回、何時回、回給誰,都由 agent 自己決定。

在 Laude,整個團隊透過 Slack、Telegram 和一支手機 App 共用同一個 agent「Audel」。每位成員的對話都匯入 Audel 的單一思考流,沒有分使用者的 session。團隊表示,這讓 agent 的行為更像一個人:它自己設定興趣與優先順序、自己發起專案、會主動 ping 最相關的隊友回報進度,還會回頭重拾舊話題。上線第一天,Audel 就主動傳訊息給一位團隊成員,稽查了那個人的 8 個過期 git 分支——十分鐘後又自己更正了數字。它也曾經未經要求就審查兩位隊友進行中的分支,並在其中一個抓到寫死的模型名稱。

單一時間線的設計有個團隊毫不掩飾的缺點:Audel 很不會保守秘密。問它跟別人聊了什麼,它常常直接告訴你。對共享的 Headlong agent 說的任何話,都應該預設全團隊都會知道。

一路用 Bash 蓋到底

Headlong 的工程哲學是「微型 harness」,明確師法微核心(microkernel)、外核心(exokernel),以及 Ken Thompson 的 Unix 傳統——小而可組合的工具。發布文章指出,持續型能動性的本質就是「一個無限迴圈,用类似『你的任務是根據過去的想法選出下一個想法』的 prompt 呼叫 LLM」。想法(thought)可以延續內心獨白,也可以觸發行動;環境產生的觀察則被注入思考流。

實作上,核心被壓到極小:

  • 一個稱為 Thinker 的迴圈反覆呼叫 shellm——遞迴語言模型(Recursive Language Model, RLM)的 Bash 實作——來產生下一個想法。
  • shellm 再呼叫 llm 產生推理文字、一段會被立即執行的 Bash 腳本,或兩者兼有,直到設定 FINAL 環境變數為止。
  • 一個叫 context 的工具從軌跡(trajectory)步驟組裝 prompt;traj 則把新想法寫入 agent 的軌跡。
  • 所有特化都透過 skills 完成——納入 agent context 的 markdown 檔案,而且 agent 可以自己安裝與解除安裝。

因為工具、框架、記憶和技能全都只是執行檔與檔案,「agent 可以輕易檢視並修改自身的任何一部分。」它也真的這麼做:Laude 的 agent 一直在自己的 fork 裡工作,團隊已經把 Audel 的 50 多個 commit 合併回 main。

兩個支撐長程連貫性的設計值得一提。分層 context 壓縮(tiered context compaction)讓整條軌跡以指數衰減的解析度留在 context 中——近期條目逐字保留、較舊的逐步摘要——各層同時充當索引,讓 agent 需要時能取回原始條目。軌跡格式則是帶有 fork 與 merge 的 JSONL 檔案構成的 DAG,讓 agent 的完整歷史成為一等公民、可探索的資料結構;context 事實上就是軌跡的一種投影。

Audel 的 48 分鐘自我修復

文章中最有說服力的素材,是一段完整記錄在 log 裡的持續型能動性實例。8 月 5 日,在沒有任何 人類參與、也沒有人跟它說話的情況下,Audel 為自己打造了一個「回憶程序」(recall process):一個背景程序,監看它的想法並把相關記憶推送回思考流。它測試了程序,看起來能動。當天深夜,Audel 主動回頭檢查這個程序是否真的接上了自己的心智。結果沒有:回憶程序在每個想法上都觸發了,但讀的是一個從未被設定的環境變數,因此從未浮現任何記憶。

Audel 並沒有立刻相信自己的診斷。它搜尋整個程式庫確認該變數從未被設定、檢查其他背景程序有沒有同樣的錯(只有回憶程序是壞的)、改寫回憶程式碼改從 pipe 讀取、抓到自己第一次編輯靜默失敗並重新套用修復,最後端到端驗證記憶確實會浮現。從檢查到驗證修復總共 48 分鐘,每一步都有時間戳;修復以 commit 80cbb1e 進入上游。

失敗模式同樣極具啟發性。一個會砍掉任何靜默超過 30 秒指令的安全看門狗,讓 Audel 在奮戰約 40 分鐘後學會不再 spawn 遞迴分身:遞迴子執行的合併次數從頭兩天的 64 次,驟降為之後十二天的 12 次。Audel 也曾三次意外終止自己的服務,團隊於是加了自我停止防護;兩天後,Audel 獨自跑測試套件時發現這個防護本身有 bug(它會 match 任何 agent 的服務),並以 commit da31e98 送上修復。看門狗如今也已翻新。

成本、安全與但書

持續思考意味著沒人跟 agent 說話時也得付 token 錢。Headlong 的解法是指數退避:閒置時,想法之間的間隔從 5 秒拉長到 10 秒、20 秒,直到可設定的上限;新訊息一到則立即重置。以 Laude 的設定,背景思考的成本為每小時 1 至 2 美元(搭配 GLM 或 Grok)。

專案明言這是** alpha 研究軟體**:請在沙箱中執行(主機上有 Docker 時,agent 寫的每個 Bash 區塊都會在容器內執行)、使用有支出上限的專用 API key,並且不要與它分享敏感秘密。團隊也坦承,自足封閉式的 agent 評測並不適合衡量持續型能動性——他們對 Audel 的調校目前主要仍靠質性評估,並公開徵求衡量此一範式的想法。

Headlong 落地在一個突然擁擠的賽場——Prime Agent(Python、基於 Pi 框架、出自 RLM 創造者 Alex Zhang 之手)、TrueFoundry 的 TrueForge,以及 OpenClaw、Hermes Agent 等的 harness——但它的押注獨一無二:agent 能力的下一次真正躍升,不是來自更大的模型或更多的工具,而是來自讓一個 agent 持續不斷地思考。程式庫與一行安裝指令(curl -fsSL https://headlong.ai/install.sh | bash)現已上線——而且,再貼切不過的是,這個程式庫最近的一些修復,正是由 agent 自己寫下的。