40 萬則 Reddit 貼文、一個模型:AI 找出臨床試驗沒發現的 GLP-1 副作用
賓大研究團隊用大型語言模型分析近 7 萬名 GLP-1 用藥者的 40 萬則 Reddit 貼文,找出月經週期改變、畏寒、潮熱與疲勞等鮮少出現在藥品標示上的訊號——也為 AI 藥物安全監測立下新範本。
當一款藥物從小眾處方藥幾乎一夜之間變成全民現象,正式的藥物安全體系就會出現時間差問題。作為黃金標準的臨床試驗天生就慢——受試者是以千計,而不是如今正在用藥的數千萬人。賓夕法尼亞大學團隊發表於《Nature Health》、並在本週掀起新一波媒體報導的研究,示範了反向操作的可能:用 AI 掃描超過 40 萬則 Reddit 貼文、來自近 7 萬名 GLP-1 用藥者,分析的規模是任何人工團隊都無法企及的。
結果是一幅真正嶄新的用藥經驗圖像:在 semaglutide(Ozempic、Wegovy、Rybelsus)與 tirzepatide(Mounjaro、Zepbound)的使用者自述中,熟悉的腸胃副作用之外,還並列著一些鮮少寫進藥品標示、也很少進入監管機關不良反應通報系統的訊號——月經不規則、畏寒、潮熱,以及原因不明的疲勞。
這項研究實際上做了什麼
賓大工程學院團隊——第一作者、電腦與資訊科學系博士生 Neil Sehgal,資深作者 Sharath Chandra Guntuku,共同作者 Lyle Ungar,以及賓大體重與飲食障礙中心研究員 Jena Shaw Tronieri——對五年的 GLP-1 相關 Reddit 討論執行了 Guntuku 所稱的「運算社群傾聽」(computational social listening)。
最難的環節從來不是蒐集貼文,而是翻譯。病人描述症狀時不會使用標準化醫學術語:有人寫「異常怕冷」,有人提「一直發冷」,也有人說「整天凍得發抖」——而臨床醫師會把這三種說法歸入同一個 MedDRA(醫學詞典監管活動術語)類別。過去要把大量非正式社群貼文對應到標準化醫學詞彙,需要極大量人工標註,大規模分析根本不切實際。
Sehgal 指出,GPT 與 Gemini 這類大型語言模型改變了這個方程式,讓研究者能以前所未有的標準化程度,快速處理並分類海量文本。團隊便利用 LLM 把非正式的症狀描述,分類到整個語料庫的標準類別中。
先驗證:已知訊號全都出現了
這項研究的一個關鍵強項,是在任何人相信它的新發現之前,方法先找到了它「應該」找到的東西。樣本中約 44% 的使用者描述了至少一種副作用,而腸胃問題位居榜首——與 semaglutide 和 tirzepatide 已知會引起的噁心和消化問題完全吻合。
「我們找到的一些副作用(像噁心)是眾所周知的,這證明這個方法確實抓到了真實訊號,」Guntuku 說。換句話說,這條管線先通過了對既有藥理學的常識檢驗,有趣的新發現才獲得關注。
被低估的訊號
在已知效應之外,有三類症狀出現頻率高到值得深入調查,卻在臨床試驗通報中被明顯低估:
- 生殖系統症狀。 在有通報副作用的使用者中,近 4% 描述了月經變化——包括非經期出血、經血量過多與週期不規則。Sehgal 指出,若只計女性樣本,這個比例還會更高。研究者將其定位為「值得調查的訊號」,而非已確立的因果關係。
- 體溫調節失調。 語料中反覆出現畏寒、異常怕冷、潮熱與類發燒症狀。
- 疲勞。 疲倦是 Reddit 資料中第二大常見的抱怨——儘管相對少有臨床試驗通報疲勞的頻率高到能觸及既定通報門檻。
下視丘(hypothalamus)或許能解釋,為什麼月經與體溫相關發現在生物學上是合理推論,而非統計雜訊。下視丘是大腦中一小塊卻極其重要的區域,掌管飢餓、荷爾蒙、生殖與體溫調節——而 GLP-1 藥物被認為正是部分透過作用於下視丘來發揮藥效。「這不代表藥物必然造成這些症狀,但它確實暗示,月經變化與體溫波動的通報值得更系統性地研究,」Tronieri 說。
是相關,不是因果——研究者自己先說清楚
這篇論文的作者對資料能支持什麼結論,態度異常謹慎。「我們不能說 GLP-1 確實造成了這些症狀,」Sehgal 說。研究發現的是線上討論中的「相關性」,而非藥物效果的證明。樣本比整體 GLP-1 用藥族群更年輕、更偏男性、更偏美國本土;而自述貼文本身也帶有偏差。
正是這份坦白讓這項工作更有價值。團隊把它定位為臨床試驗的「快速假說產生器」,而非替代品:「臨床試驗是黃金標準,但它在設計上就是慢的,」Guntuku 說。「這不是試驗的替代品,但它能快得多——而當一款藥幾乎一夜之間從小眾變成主流,速度就是一切。」
為什麼是現在:LLM 解開了人工標註的枷鎖
Ungar 不是第一次做這件事——早在 2011 年,他就參與了最早一批利用網路使用者生成內容挖掘藥物不良反應的研究。概念很老,成本卻曾經高得嚇人。在 LLM 出現之前,把數十萬則非正式貼文對應到 MedDRA 代碼需要龐大的人工標註量,語料庫規模因此被卡死在這個量級的一小部分。
「線上病人社群的運作方式很像街坊巷弄的口耳相傳,」Ungar 說。「與這些藥物共同生活的人即時交換筆記,分享那些很少進到診間或正式通報系統的經驗。」LLM 分類技術終於讓這條「巷弄八卦線」在人口尺度上變得可搜尋。
更大的棋局:快速流行產品的預警系統
前瞻性的意義超出 GLP-1 本身。监管寬鬆或根本不受监管的產品——注射型胜肽、保健食品、各種「養生配方」——在 Reddit、TikTok 等平台上擴散的速度,遠快於傳統研究登記它們存在的速度。對這些對話的 AI 分析,可能成為新興健康疑慮的早期預警系統,提供意料之外效應的最早線索之一。
賓大團隊的下一步正反映了這個企圖:跨出 Reddit、跨出英語社群,檢驗同樣的型態是否在不同族群與平台上成立。利益揭露方面,研究未接受外部經費;Tronieri 通報曾代表賓大接受 Novo Nordisk 的研究者發起型補助,並收取 Currax Pharmaceuticals 顧問費,其餘作者皆申報無利益衝突。
結語
這篇研究真正的主角与其說是 Ozempic,不如說是方法論。當一款爆款藥物在數個月內觸及數千萬人,這些病人在網路上的集體對話,就是世上最大的「事實上」上市後監測資料集——在有能力全部讀完之前,它形同隱形。LLM 辦得到。它挖出的訊號是線索而非判決,但臨床研究靠的正是線索。藥物安全監測過去只能看見病人向醫師、藥廠與監管者通報的內容;如今,街坊八卦線正式成為可採信的證據來源。
Sources
- [1] https://www.sciencedaily.com/releases/2026/09/260912222856.htm
- [2] https://www.engineering.upenn.edu/stories/penn-researchers-use-ai-to-surface-unreported-glp-1-side-effects-in-reddit-posts/
- [3] https://www.insideprecisionmedicine.com/topics/informatics/ai-finds-unreported-side-effects-of-glp-1-drugs-in-reddit-posts/
- [4] https://www.foxnews.com/health/popular-weight-loss-medications-linked-hidden-side-effects-study-finds