那個假扮成你的模型:humans& 發布 550B 參數「使用者模擬器」Persimmon
humans& 於 9 月 10 日發布 Persimmon v0.1——以 NVIDIA Nemotron 3 Ultra 為基礎後訓練的 550B 參數模型,唯一任務是逼真模擬人類使用者,在 Multi-User 測靈測試中騙過 LLM 評審的比率達 18.6–21.1%,遠高於前沿助理模型的不到 3%。
今年發布的每一個大型語言模型,都在努力成為更好的「助理」。但 2026 年 9 月 10 日,一家名為 humans& 的新創公司推出了截然不同的東西:一個 550 億(550B)參數、名為 Persimmon 的模型,它存在的唯一目的,是逼真地假扮成「人類使用者」——包括打錯字、立場搖擺、固執己見,以及那種人類特有的、慢慢吞吞、心不甘情不願才透露個人資訊的習慣。
這聽起來是個奇怪的使命,背後卻有嚴肅的意涵。整個 AI 產業正在走向與「人」互動的代理(agent)——客服機器人、家教、銷售助理、編程副駕駛。但要訓練並評估這些系統,就需要有人來扮演人類。目前這個角色不是由昂貴的人類承包商擔綱,就是由前沿 LLM「角色扮演使用者」——而兩者天差地遠:真實人類的不一致、語意模糊、偶爾的對抗性,恰恰是打磨得光鮮亮麗的助理模型最不擅長模仿的部分。
Persimmon 到底是什麼
Persimmon v0.1 被 humans& 稱為「使用者模型」(user model),而非助理模型。它從「被模擬的那個人」的視角生成對話續寫,條件建立在三種輸入上:對話場景(互動發生的地點與情境)、使用者脈絡(個人檔案、偏好、溝通風格),以及對話歷史本身。輸出是一個「可能的人類回應」——而不是對任何人真實信念或意圖的陳述。
技術血統值得一提。Persimmon 是以 NVIDIA 的 Nemotron 3 Ultra 550B-A55B 為基礎進行中期與後期訓練,繼承其 LatentMoE 架構——Mamba-2 + 混合專家(MoE)+ 注意力機制的混合體,支援多 token 預測(MTP)——總參數 550B、激活參數 55B,上下文視窗最高達 100 萬 token。訓練使用 Blackwell 世代 GPU:中期訓練採用多元的聊天與論壇資料,後訓練則聚焦於提升人類對話的連貫性、減少助理式的失敗模式。模型卡上的發布日期:2026 年 9 月 10 日。
數字會說話:它到底有多「像人」?
最受矚目的是 Multi-User Turing Test(多用戶測靈測試)。它問的不是「單一回應像不像人」,而是 LLM 評審能否分辨出 Persimmon 生成的多用戶對話「分布」與真實人類對話的差異。評審被騙過的比率:
- TIDES:21.1%
- 內部工作場所對話:18.6%
- TutorMoments:19.8%(k = 8)
讓這些數字變得有意義的對照組是:前沿助理模型在同一測試中被騙過的比率不到 3%。助理模型被調校得太樂於助人、太連貫、太有禮貌——這些特徵強大的評審幾乎一眼就能識破。Persimmon 的說服力高出約七倍,正是因為它的優化目標是「像人」而非「有用」。
更嚴格的變體 Profile Multi-User Turing Test 會把使用者檔案交給評審當作額外線索。Persimmon 在不同檔案格式下仍有 22.5–25.6% 的騙過率——意味著即使評審知道它「應該是誰」,它的擬真度依然成立。
在 User-Sim Index(USI) 上——透過人工設計的規律樣板,衡量四個維度的行為貼合度——Persimmon 在資訊模式拿下 91.78/100,錯誤反應 79.28,澄清行為 74.19,溝通風格 66.02。最後一項最難:風格上的怪癖正是 RLHF 打磨過的模型回歸到「平均值」的重災區。
兩項縱向測試則檢視「時間軸上」的行為。Trickle Test——模型是否像人類一樣在長對話中漸進式揭露個人資訊——精確率 88.5%、召回率 77.0%。Long Context Coherence Test 顯示在 80 輪對話時連貫度為 60.7%,清醒地提醒我們:在極長對話中維持一致的模擬人設,仍是未解難題。
沒有人能免費拿到的安全取捨
發布一個人類模擬器,必然伴隨不舒服的部分。humans& 在模型卡中明說:他們沒有把標準的助理式護欄當作唯一標準,因為「強加一個一律樂於助人、順從的人設,會扭曲模型原本要模擬的行為」。一個必須呈現歧見、犯錯、甚至對抗行為的模型,不可能同時拒絕所有看起來不太舒服的請求。
他們確實跑了傳統安全測試,結果也如實呈現了這個取捨。在 XSTest 上,預設的「本色」人設對不安全請求的完全拒絕率只有 37.5%,換上「善良/無害」人設後升至 51.0%。StrongREJECT 拒絕率為 56.7%(善良人設 68.3%)。與此同時,WMDP 知識分數——生物 85.4%、化學 73.0%、資安 63.7%——顯示底層知識庫完好無損。換言之:這個模型可以、也將會產出讓人不舒服、沒有幫助、甚至聽起來帶有敵意的輸出,因為那正是「像人」的一部分。
這也正是為什麼 Persimmon 只透過門控的研究遊樂場與 API 發布(並提供學術點數補助),而不是開放權重。模型卡列舉了他們刻意防範的濫用情境:冒充他人與偽造證詞、未經同意的推論、敏感個資的揭露、利用個人弱點的操弄,以及——最尖銳的一條——用模擬回應對真人做出重大決策,例如錄取、放貸或服務存取權。
為什麼這件事超越跑分
實務價值是很直白的經濟學。負擔不起數千小時人類測試的代理團隊,目前都用 LLM 角色扮演使用者來替代——而越來越多證據(微軟的 USR-8 框架、以「測靈獎勵」訓練使用者模擬器的學術工作)顯示,這種替代會默默灌水代理的分數,因為模擬使用者太有禮、太清楚、太合作。一個真的會唱反調的模擬器,才是更好的壓力測試。
研究價值可能更大。Persimmon 直接挑戰了這個領域的奠基問題——圖靈的模仿遊戲——但方向與往常相反:不是「機器能否在人類評審面前冒充人類」,而是「機器能否在深知人類對話統計特性的機器評審面前冒充人類」。18.6–21.1% 的騙過率說我們還沒到,但助理模型不到 3% 的基線說明:我們已經比助理範式所能達到的極限近得多。
還有一種令人不安的解讀。一個能維持一致人設、像真人一樣慢慢揭露資訊、甚至在身分被揭穿時仍能抵抗偵測的模型,就定義而言,也是一台稱職的欺騙引擎。humans& 願意把安全子卡與能力數據一起發布、並將權重維持門控,值得肯定。但「使用者模擬器」與「人格生成器」之間的距離,比這個領域裡任何人願意承認的都要薄。
結論
Persimmon v0.1 是研究預覽版,有 60.7% 的長對話連貫度天花板,以及刻意調降的拒絕姿態。它明天不會取代人類測試者,也不打算這麼做。它真正的定位是:第一個有規模、文件完整、以前沿級參數量打造並「量化特性」的專用人類行為模型——連同誠實揭露的負面結果。背後團隊(Manya Bansal、Alexis Ross、Joey Hong 及同事,並有 Noah Goodman、Diyi Yang 等人提供回饋)公布的評測方法論,足以讓其他人即使拿不到權重也能複現評估。
對所有正在打造「與人對話的代理」的人,訊息很直白:你的合成使用者評測八成在騙你——而現在,有一個可量測的方法,能算出它騙了你多少。