50 萬場面試交給一個 AI:HackerRank 的 Chakra 結束測試,重新定義技術徵才
歷經六個月測試、為 Snowflake、Snorkel 與 Capgemini 執行超過 50 萬場面試後,HackerRank 的 AI 面試官 Chakra 正式上市——把三輪徵才流程壓縮成一場,並把評估重點押在「AI 駕馭力」上。
2026 年 10 月 5 日(週一),HackerRank 將 Chakra 從測試版推向正式版。這個 AI agent 會主持技術面試、即時觀察候選人工作的過程,並評估他們「怎麼想」,而不只是「做出什麼」。讓這次發布超越一般產品上線的,是它的規模:在大約六個月的測試期間,Chakra 執行了超過 50 萬場面試,Snowflake、Snorkel 與 Capgemini 都位列試用企業之列。對一個過去兩年還在戰戰兢兢實驗語音篩選機器人的徵才產業來說,這是「後測試時代」工業級 AI 面試官的第一個明確樣板。
一場「像在上班」的面試
Chakra 的設計刻意告別 HackerRank 賴以起家的程式測驗格式。候選人拿到的不是孤立的解謎題,而是植基於真實程式碼儲存庫的任務,並在一個內建 AI 助手的畫布中動手解題。當候選人工作時,Chakra 會依據當下情境即時追問:為什麼選這個做法而不是另一個?如果中途冒出一個新限制,你的解法要怎麼調整?
後面這點正是核心。HackerRank 共同創辦人兼 CEO Vivek Ravisankar 認為,AI 已經讓「只看成品」的評估方式失效。「過去的評估模式是評價產出,」他接受 TechCrunch 採訪時說,「現在因為 AI,任何人都能產出一個像樣的東西。」當一份能動的實作只需一個 prompt,評估訊號就轉移到背後的推理過程——批判性思考、判斷力,以及 HackerRank 所稱的「AI 駕馭力」(AI fluency):候選人如何把問題描述給 AI、如何判斷 AI 給的答案、如何引導它走向真正可用的解方。
作弊警示下降 70–80%
測試數據中最反直覺的發現:在面試中開放候選人使用 AI,非但沒有助長作弊,反而讓可疑行為大幅減少。Ravisankar 表示,Chakra 面試的可疑活動警示比傳統 HackerRank 評測低了 70–80%(依地區與資歷而有差異)。解釋在於誘因設計——當 AI 就擺在桌上,偷渡外部工具餵答案的效益基本上消失了。面試不再是比誰藏得好的軍備競賽,而是一場公開測試:看你能不能與實際工作中會用的工具好好協作。
結構上的經濟效益同樣驚人。過去需要三個獨立關卡——招募人員初篩、回家作業、工程師複試——現在壓縮成一場 Chakra 面試。對於每年篩選數千名候選人的工程組織而言,這不是漸進式的效率提升,而是整個漏斗的重新設計。
刻意吞噬自己的本業
整個故事最有意思的部分,或許是 Chakra 根本是一場針對 HackerRank 自身命脈的豪賭。這家公司 2012 年在 TechCrunch Disrupt 登場、走過 Y Combinator,靠程式設計挑戰建立起品牌,如今服務超過 3,000 家企業客戶——包括 Amazon、Nvidia、Clay 與 Replit——並坐擁逾 3,000 萬人的開發者社群。傳統產品測的是工程師能不能把題目解對。Ravisankar 現在認為,那個模式量錯了東西。
在內部,他把這次轉型比擬為 Apple 從 iPod 走向 iPhone:舊產品仍有價值,但新產品才是市場的方向。「Chakra 會成為頭條,」他說,「它將是我們前進的方式。」
錄用決定暫時還留給人類
讓 AI 在評估中扮演更深的角色,立刻引發治理問題:徵才決定到底該授權給演算法多少?Ravisankar 的定調是:Chakra 負責評分,不做錄用決定。agent 處理面試中結構化的部分,對每位候選人一致地套用雇主設定的評分標準;人類面試官則把時間拿回來,做人類真正擅長的事——判斷自己是否真的想跟這個人共事,並回答候選人關於團隊與職缺的提問。
「只要調校得當,AI 比人類偏見少得多,」Ravisankar 主張,理由是系統可以被要求對每位候選人遵循同樣的標準,不受學經歷背景影響。但批評者會反駁——報導中也點出——一致地套用標準並不代表系統沒有偏見:自動化徵才工具可能繼承甚至放大建造它的資料、模型與評分標準中的偏差。這正是監管機構緊盯的原因。紐約市已要求特定自動化聘僱決策工具必須通過獨立偏見稽核,並在使用前告知候選人;Ravisankar 也坦承,在這個受監管的領域,合規正是 HackerRank 必須先行打造的工程之一。
這意味著什麼
三個值得咀嚼的觀察:
- 評估正在從「成品」轉向「過程」。 當任何人都能生成一份像樣的成品,可辯護的訊號變成推理軌跡——問題怎麼被框定、AI 產出怎麼被檢驗、限制怎麼被協商。「AI 駕馭力」作為一項計分能力,很快就會擴散到 HackerRank 之外。
- 用「開放」取代「防堵」來反作弊。 可疑活動警示下降 70–80% 意味著:AI 時代的防弊面試,靠的可能不是監控,而是把工具使用合法化。這直接顛覆了監考產業十年的假設。
- 在位者先顛覆自己。 HackerRank 有一百個理由守護程式測驗生意,卻選擇推出削弱它的產品——iPod 到 iPhone 的劇本,而且背後有 50 萬場測試面試的實證。
懸而未決的,是監管機關與候選人會持續追問的問題:評分標準的可稽核性、被 agent 打低分的候選人有沒有申訴管道,以及「只要調校得當就比人類少偏見」這句話能不能通過勞動法規的考驗。但方向已定:技術面試正在變成一場人與 AI 並肩工作的過程——而被評分的,是人的判斷力。
資料來源列於文章 metadata 中。