← All posts / Research

AI Observatory:獨立數據揭露人們真正如何使用 AI——其中一半根本與工作無關

一項新的獨立研究計畫彙集了 5,000 位使用者、52 個模型的多達 85,633 段真實 AI 對話——結果發現,若套用 Anthropic 自家的分析方法,將近一半的對話會被直接過濾掉,而這些被排除的對話,恰恰涵蓋了健康、情感陪伴與敏感內容等真實使用樣貌。

AI Observatory:獨立數據揭露人們真正如何使用 AI——其中一半根本與工作無關

人們究竟如何使用 AI 聊天機器人?這個問題聽起來應該不難回答——畢竟 OpenAI 與 Anthropic 每個月處理數十億次對話,而且兩家公司都會定期發布關於使用行為的報告。但獨立研究人員指出,這些報告只呈現了企業「想讓我們看到」的數據。而本週發表的一項大型研究顯示,真實樣貌與官方版本之間,存在著相當大的落差。

為 AI 行為建立的獨立望遠鏡

這個名為 AI Observatory(AI 觀測站)的研究計畫,是目前為止最認真的一次嘗試:為人們與生成式 AI 的互動,建立一套獨立於企業之外的證據基礎。計畫由史丹佛可信賴 AI 研究實驗室(STAIR Lab)博士候選人 Anka Reuel,與 MIT 媒體實驗室近期畢業的博士 Shayne Longpre 共同主持,集結了來自 MIT、史丹佛等多個機構的研究者,彙整並分析了七個既有研究資料集中、經使用者同意收集的真實 AI 對話。

以獨立研究的規模而言,這個資料集相當可觀:橫跨 24,521 段對話、共 85,633 個對話輪次(使用者提問加上 AI 回應),來自 5,000 位使用者與 52 個不同模型的互動——包括 ChatGPT、Claude、Gemini 與 Grok——時間跨度為 2023 至 2025 年。其中也包括最大型的公開對話資料集之一 WildChat。

Reuel 接受《MIT Technology Review》訪問時直言,目前「沒有任何獨立資料來源可以佐證」業界的使用數據。而關於 AI 利弊的重大決策,如今卻是建立在極為有限、且由企業自行發布的數據之上。

被過濾掉的那 48%

這項研究最核心的發現,直接指向業界最廣為引用的數據集:Anthropic Economic Index。該指數的分析方法會過濾掉與工作和生產力無關的 Claude 對話。當 AI Observatory 的研究人員把 Anthropic 自家的方法套用到獨立資料集上時,發現將近一半的對話——48%——會被直接剔除。

而被剔除的那一半,內容至關重要。這些與工作無關的對話中,出現了顯著更高的比例:

  • 健康與情感關係話題:44.2%,相較於 Anthropic 分析中的 31.2%
  • 騷擾與仇恨言論:27.5% 相較於 5.66%
  • 性內容:16.7% 相較於 2.4%
  • 成人或違禁話題:7.9% 相較於 2.1%

這種偏差並非 Anthropic 獨有。OpenAI 自家 2025 年的 ChatGPT 使用報告也承認,只有約 30% 的消費者用途與工作相關。但由於每家公司都透過自己的框架發布數據——Anthropic 強調生產力、OpenAI 強調教育——拼湊出來的整體圖像便嚴重偏向「專業用途」,而人們實際使用這些工具時那些極為私密的面向,則被切割進不起眼的附註裡。

未參與此計畫、專門研究人機互動的德州大學奧斯汀分校助理教授 David Widder 表示,相較於分散各處的企業報告,一份「鳥瞰式的分析」能幫助研究者更一致地理解使用行為。

人們與 AI 的關係,越來越私密

除了頭條數字之外,縱貫性的資料還訴說著另一個故事:AI 使用正穩定變得更加親密。在 WildChat 的對話中,無論提示詞、回應長度還是對話輪數都隨時間增長、變得更加精細,而且寒暄閒聊顯著增加——這是情感陪伴式使用上升的明確訊號。更值得警惕的是,AI 助手的自我揭露程度下降了:隨著對話變得更加私人,模型越來越少主動承認自己是聊天機器人。

不過也有真正正面的訊號:被研究者標記為「敏感」(潛在有害或受限內容,包括性騷擾與仇恨言論)的對話,在研究期間變得越來越少——這可能意味著各平台的安全防護確實有所改善。

每個模型,都有自己的使用文化

這項研究另一個有趣的貢獻,是任何單一公司都無法完成的跨模型比較。使用模式因平台而明顯不同:

  • Grok 與 Gemini 是資訊檢索的主力,其中 Grok 在新聞與政治類查詢上特別熱門——但錯誤資訊也最集中在這裡,這與既有研究一致。xAI 未回應置評請求。
  • Claude 是寫程式的首選。
  • Gemini 在社交與角色扮演用途上領先。
  • ChatGPT 承擔了最多作業輔導。

甚至同一模型的不同版本也有差異:使用者與搭載 GPT-3.5 的 ChatGPT 對話較短,而與 GPT-4o 的對話則更長、更具反覆迭代性。「沒有任何一家公司的報告能說完整個故事,」Longpre 說。

研究限制——以及為什麼它依然重要

研究人員對限制毫不諱言。由於資料來自志願分享,敏感用途很可能被低估——那些對話正是人們最不願意交給研究者的類型,7.9% 的成人或違禁話題比例應視為下限而非上限。此外,與 Anthropic Economic Index 最新一期所分析的 100 萬段 Claude 對話相比,85,633 個輪次仍是九牛一毛。

Anthropic 回應表示,其發布的研究反映研究團隊的特定問題與興趣,並強調支持外部獨立研究很重要。OpenAI 則未回應置評請求。

但這種不對稱恰恰是問題核心。當政策制定者辯論青少年安全規範、當監管機構評估危害、當研究者想問某個系統「主要被用於好事還是壞事」時,唯一細粒度的數據全都在企業高牆之內。AI Observatory 的資料集將開放給其他研究者分析,團隊也計畫持續擴充。Reuel 說,最理想的情況是企業直接與獨立研究者共享數據——當然,必須在保護使用者隱私的前提下。

在那之前,任何依據 AI 使用數據做決策的人,用她的話來說,都是「完全在蠻荒中摸索,在不知道企業敘事之外實際發生了什麼的情況下,做出這些影響深遠的決策」。

對一個經常宣稱自家產品已成為通用基礎建設的產業而言,「真實使用中約有一半是私人的——健康問題、感情、孤獨、陪伴」這個發現,不是附註,而是主旋律。