← All posts / Models

把難說出口的話寫得像人:27B 開源模型 Hemmingway-1 擊敗 GPT-6 Astra

瑞士與南非合組的獨立實驗室 Altworld 開源 Hemmingway-1:以 Qwen3.8-27B 為基底、Apache-2.0 授權的 27B 微調模型,專注日常寫作,在擬人度、困難訊息與 EQ-Bench 4 上勝過一線大模型。

把難說出口的話寫得像人:27B 開源模型 Hemmingway-1 擊敗 GPT-6 Astra

請一線大模型幫你草擬「傳給房東、關於壞掉鍋爐」的訊息,你多半會收到三個選項、一段開場白,外加一頁解釋這些選項的說明。一個小型獨立實驗室想改變這件事的「好」的定義。2026 年 9 月 21 日,橫跨瑞士與南非的團隊 Altworld 發布了 Hemmingway-1:一個以阿里巴巴 Qwen3.8-27B 為基底、270 億參數的微調模型,目標單一而明確——用一般人彼此溝通時真正的寫法來寫東西。權重以 Apache-2.0 授權上架 Hugging Face,開放原始權重下載,一行 vLLM 指令即可部署,Hemmingway.io 品牌下還提供 Mac 與 Android 應用程式。

它究竟是什麼

剝掉行銷話術,規格表很短:270 億參數、基底為 Qwen3.8-27B、262,144 token 上下文視窗、Apache-2.0 授權、可商用、無附加條款。團隊表示它鎖定故事、對話、角色扮演與短篇個人文字——這些正是通用助理最容易「過度生產」的類別。在公開的情感智慧基準 EQ-Bench 4 上(由該基準自己的評測框架執行,而非實驗室自己跑分),這個模型拿到 1330 分、總排名第三——越過 GPT-5.5、Claude Opus 4.7 與 Opus 4.8,距離榜首只有十二分之遙。對一個透過 r/MachineLearning 自發貼文低調問世的 27B 微調模型來說,光這個排名就足以讓人側目。

更有意思的是實驗室自建的幾項測試。在 CommunicationBench 上——八十個真實日常寫作請求,以盲測一對一對決方式評判,裁判是另一個模型,且答案順序隨機對調——Hemmingway-1 擊敗了團隊測試的所有對手:Fable 5.1、GPT-6 Astra、Kimi K3、GLM-5.3、Grok 4.6 與 DeepSeek V4 Pro。在配套的「擬人度」測試中,問題只有一句:「這兩則哪一則是人寫的?」它以領先第二名二十六分的差距奪冠。而在「困難請求」——那些你反覆修改、遲遲發不出去的訊息——上差距更為戲劇化:GPT-6 Astra 的回答被認為像人寫的比例是 9%,Hemmingway-1 則是 72%。

反對「備忘錄文化」的論證

模型卡中有一項測量值得特別注意,因為它直指助理式寫作的真實痛點:模型有多常把真正的文字埋進註解、選項與說明裡。按實驗室的統計,Fable 5、GLM-5.3 與 Kimi K3 在十則回覆中有超過九則會這樣做。Hemmingway-1 被訓練成直接給你訊息本體,而不是一份「關於訊息的備忘錄」。這既是能力主張,也是產品哲學——人們委託 AI 的「寫作」大多數是简短、人際、高度依賴語境的,而助理慣例中的選項化與解說化反而讓它變糟。

模型卡「但書」段落的老實程度同樣罕見。實驗室事先聲明:CommunicationBench、Human-Likeness 與 StoryBench 是自建基準,由他們設計與執行;每次對決皆為盲測、兩種順序各跑一次以免位置偏誤,裁判模型永遠不同於受測模型。他們也坦白模型輸在哪裡:敵意敘事與長篇故事輪次,專職故事模型在這些項目確實更強。並警告此模型以英文為主、可能「錯得很篤定」——明確不建議用於醫療、法律或財務決策。

為什麼這不只是一個模型的事

2026 年尾的兩股潮流,讓這次發布超出花邊新聞的層次。第一股,是開源權重模型從「樣樣略遜」轉向「單項刻意更強」。Hemmingway-1 不追推理基準、不做代理框架,它把一個強大的開源基底微調,對準一線實驗室只順帶優化的日常行為切片。當一個 27B 模型在「聽起來像人」上擊敗旗艦模型,「能力只存在於參數規模頂端」的論述就弱了一截——至少對大多數人最常執行的任務而言是如此。

第二股潮流是可信度經濟學。同一週,公眾正為一線實驗室是否誇大 AI 風險敘事、「自主駭客」事件是否其實是關掉防護的指示性測試而激烈交鋒;此時一個「頭條基準自建但方法學完全揭露」的發布,讀起來格外不同。r/LocalLLM、r/WritingWithAI 與 r/Vllm 社群的反應——使用者確認模型在 vLLM 開箱即用、連 MTP 都包含——正是開放權重使得、而封閉 API 做不到的那種驗證。

怎麼跑

入門門檻是一行指令:

vllm serve Altworld/Hemmingway-1 --max-model-len 262144

模型卡也提供標準 transformers 程式碼片段,團隊並為非終端機用戶提供桌面與行動應用。27B 的體積代表它塞得進單張高階消費級 GPU;262K 上下文則能裝下一整本小說、一整年書信往來或一場漫長的角色扮演,無需外部檢索。開放權重、寬鬆授權、消費級硬體 footprint、加上巨頭不優先經營的專長——這個組合正是獨立實驗室屢屢以小搏大的利基。

計畫自己的說法是最鋒利的總結:這個模型存在,是為了讓你「拿到訊息,而不是備忘錄」。Altworld 的自建基準能否经得起第三方複驗,是懸而未決的問題。但 EQ-Bench 4 的排名是外部的、權重是可下載的,而任何人都能做的測試只花一句 prompt。請你現在的助理寫那則你一直拖延的尷尬訊息——再問 Hemmingway 一次,然後看看哪一則你真的敢按傳送。