三個人、72 小時、一家公司:SpaceXAI 的 Grok Bot Galaxy 把 AI Agent 送上實況直播
SpaceXAI 正在直播一支三人團隊用 Grok Bot agent 從零打造一整家公司——這場為期 72 小時的公開壓力測試已於 9 月 15 日在舊金山展開。
2026 年 9 月 15 日,SpaceXAI 啟動了 AI 歷史上最大膽的產品演示之一:Grok Bot Galaxy——一場為期三天的直播實驗,三人團隊要嘗試從零打造一整家公司,而真正做事的「員工」不是人類,而是 Grok Bot agent。
這場活動於 9 月 15 日至 17 日在舊金山 The Howard 舉行,每天約從太平洋時間早上 8:30 到下午 6:00 提供免費公開直播。活動結束時,SpaceXAI 要麼拿得出一家能運作的公司,要麼收穫一場非常公開的失敗。
設定:人類當管理者,Agent 當勞動力
三位建造者是 Matt Palmer、Lauren Tan 與 Roshan Sadanani——他們都出身 SpaceXAI,曾參與 Cursor 與 Grok Bot 本身的開發。限制條件相當嚴苛:他們從一張白紙開始。沒有預先準備好的點子、沒有現成的程式碼庫、沒有寫好的商業計畫。直播期間,他們必須現場決定要做什麼,然後一路走過商業規劃、產品決策與工程實作——過程中把 Grok Bot 當成員工,涵蓋創意發想、商業規劃、產品設計與執行。
這個框架很重要。這不是那種最後才推出打磨光鮮產品的展示會,而更像是基礎設施版的實境秀:連續、不剪接、每天九小時以上,每一個 prompt、每一次 agent 犯錯、每一次補救,全都攤在觀眾眼前。如果 bot 忘了上下文、原地打轉,或產出必須重做的東西,所有人都會即時看到。
SpaceXAI 為什麼要這麼做
Grok Bot 自推出以來成長曲線相當驚人。根據 Lenny’s Newsletter 對協助孵化這個產品的 Roman Ugarte 的專訪,一個小型隔離團隊只花了大約一個月就建出 Grok Bot——推出具備內部可觀測性工具的知識工作 agent,這種工具在多數企業軟體團隊眼裡是得做好幾年的專案。產品主張很簡單:一隊全年無休的 AI 員工,在你睡覺時處理 email、潛在客戶篩選、草稿撰寫、監控與研究。
但 Agentic AI 有一個信任問題。每一家供應商都宣稱自己的 agent 能「自主完成工作」,而每一位企業買家都有資料夾專門存放那些悄悄不了了之的試點專案。示範影片與實際上線第二天之間的落差,仍是這個產業不能說的秘密。Grok Bot Galaxy 正是 SpaceXAI 對這種質疑的回應:別用說的,直接直播 72 小時給你看,不剪接。
這背後也有競爭考量。市面上做 agent 的產品不只 Grok Bot——Anthropic 的 Claude Code 生態系、OpenAI 的操作員型工具,還有一票新創公司都在追逐同樣的「AI 替你幹活」承諾。透過舉辦迄今最公開的壓力測試,SpaceXAI 等於是在向整個產業下戰帖:如果你家的 agent 真有行銷說的那麼好,就讓它上鏡頭三天看看。
這場實驗真正在測什麼
剝掉熱鬧的表象,Grok Bot Galaxy 其實是在即時測量 agentic AI 的四個難題:
一、長時間軸的連貫性。 Agent 能否在三天不斷累積的上下文中維持計畫——記住決策、記住限制條件,而不會把昨天做好的東西弄壞?長時間工作階段的上下文衰減仍是 agent 團隊最常見的失敗模式,而連續直播沒有暫停或重來的機會。
二、分工協作。 那個紅極一時的 Grok Bot 工作流模式——由「幕僚長」agent 把工作分派給具名的專家 agent——在架構圖上看起來很優雅。Galaxy 測的是當工作對象是一家真正的公司、各部分互相依賴時,這套模式還撐不撐得住:品牌決策限制產品,產品決策限制定價,定價決策又限制行銷網站。
三、人機協作的經濟學。 這三個人類是管理者,不是寫程式的人。活動真正的指標不是這家公司做得多出色,而是人類介入量與 agent 產出的比例。每當 Palmer、Tan 或 Sadanani 必須跳出來修正、改方向或重做,那就是一個數據點,標示 agentic 勞動力距離真正取代初級團隊還有多遠。
四、對公開失敗的容忍度。 Agent 的失敗方式很怪——充滿自信地呼叫錯誤的 API、憑空捏造事實、陷入迴圈。多數公司把這些失敗藏起來,SpaceXAI 則賭「透明面對失敗模式」比遮掩更能建立信任。這個賭注與 Grok Bot 本身的開發方式一脈相承:團隊直接推出開發者等級的可觀測性,把模型思考過程與記憶軌跡攤開來,而不是藏起來。
對 Agent 經濟的意義
時間點是精心挑選的。這個月的 agentic AI 新聞密度罕見地高:OpenAI 的 GPT-6 Astra 分階段上線、強調工具使用;Anthropic 發布威脅情資報告,詳述自家模型如何被大規模濫用;再加上 Anthropic 執行長 Dario Amodei 呼吁放慢能力增長所引發的產業論戰——實驗室到底能不能自我約束。在這個背景下,一場不加修飾、不照稿演出、公開展示 agent 能與不能的演示,既是有力的行銷,也是某種公共服務。
對方興未艾的「AI 員工」市場而言,這場活動是一個基準點。如果三個人加 agent 團隊真能在 72 小時內做出一家公司——完成設立、有品牌、產品上線、至少有可運作的獲客漏斗——那將重新校準小團隊對工具的期待。如果做不到,產業則會得到一張誠實的地圖,標出那道牆在哪裡:哪些任務 agent 能乾淨吞下(樣板程式碼、文案、研究整合),哪些環節人類仍是瓶頸(品味、判斷、整合)。
它也迫使我們思考「驗證」這件事。用這種速度蓋出來的公司,可信度取決於來源:程式碼到底是 agent 寫的,還是人類偷偷救場?SpaceXAI 選擇連續直播、不做剪接,是目前所能給出最強的保證——這份工作確實如其所述。
如何觀看
直播將持續到 9 月 17 日,每天太平洋時間 8:30 至 18:00,實體活動在舊金山 The Howard 舉行,遠端可透過活動的 Luma 頁面與 SpaceXAI 官方頻道免費收看。每天早上 9:00 起,場次包含現場實作與 Grok Bot 團隊的手把手建造過程。
無論 Galaxy 最後留下的是一家公司還是一則警世寓言,有一點是确定的:到星期四傍晚,我們對 agentic AI 真實狀態的理解,將遠多於星期一早上——而且很長一段時間內,沒有任何供應商能再躲剪接過的示範影片後面。
Sources
- [1] https://x.ai/galaxy
- [2] https://tech.yahoo.com/ai/meta-ai/articles/ai-build-startup-72-hours-132338484.html
- [3] https://www.varindia.com/news/spacex-ai-team-to-build-a-company-live-with-grok-bot
- [4] https://cellcog.ai/blog/grok-bot-galaxy/
- [5] https://www.lennysnewsletter.com/p/how-we-built-grok-bot-in-a-month