Anthropic 公開 AI 實驗室三組內部指標:3萬代理、十億次決策與6%安全算力意味著什麼
CoinMeta
09-20 09:52
Ai 焦點
Anthropic 在9月17日提出了一套觀察AI開發速度的指標,試圖回答外界長期未能看到的三個問題:AI在多大程度上參與了下一代AI的研發;公司能否監控內部代理的行動;計算資源究竟有多少用於安全工作。公司同時提供了內部數據快照,包括2026年8月某一時刻最常用的研發平臺上有約3萬個代理在運行,在線監控當月檢查超過十億次決策,以及在一週的樣本中約6%的AI研發算力被歸類為安全工作。
有幫助
No.幫助

Anthropic 在9月17日提出了一套觀察AI開發速度的指標,試圖回答外界長期未能看到的三個問題:AI在多大程度上參與了下一代AI的研發;公司能否監控內部代理的行動;計算資源究竟有多少用於安全工作。公司同時提供了內部數據快照,包括2026年8月任意一時刻最常用的研發平臺上約有3萬個代理在運行,在線監控當月檢查超過十億次決策,以及在一週的樣本中約6%的AI研發算力被歸類為安全工作。

這些數字並非監管審計的結論,亦非業界的統一標準。研發自動化指數由 Anthropic 自行設計,並大量使用 Claude 來整理任務和評分;代理監控僅覆蓋所描述的主要內部平台;算力分配則來自7月13日至20日的一週快照。官方將其定位為原型測量,期望未來能由獨立第三方進行驗證,并在不同實驗室之間形成可比對的標準。

從「AI 助理研究員」到「AI 領導研發」,首先需要知道自動化是發生在什麼地方

Anthropic 构建了 R& D Automation Index。團隊從 Slack 和內部文件中抽樣整理了約 1.5 萬個細粒度的研發任務,再組織成一個包含 542 個節點、378 個子任務的層級樹。每類任務都根據 Epoch AI 提出的六級評分標準進行評估:從 AL0 沒有 AI 參與,到 AL5 完全自主,中間依次包括輕度使用、輔助、協作和主導。最後再根據人員在各项任務上投入的時間來估算權重。

這比統計員工發送了多少條 Claude 消息更接近實際工作,因為一條消息可能只是改寫句子,也有可能完成一次實驗設計。但方法仍有局限。任務樹在特定時期被凍結,若員工因 AI 的出現而轉向全新工作,舊的評估方式未必能捕捉到;重要性用人工來代理評估,也不能衡量某項少量工作對模型能力的巨大影響;評分模型又來自被評估公司的自有系統。

Anthropic 要求相關領域的員工在不知道模型證據和結論的情況下獨立評分。官方稱模型與人類給出的完全相同等級的比例為59%,人類之間完全一致的比例只有35%;模型與人類相差不超過一級的比例為97%。這些結果表明邊界判斷本來就主觀,也說明了「AI 協作」與「AI 主導」不能被包裝成精確的物理量。指數更適合觀察同一標準隨時間的變化,而不是用一個分數來宣告已經實現自主研發。

公司希望公開 AI 參與研發的程度,是因為模型加速自身的開發可能縮短人類理解和干預的時間。自動化提高也可能帶來更多安全實驗和測試,不能只被解釋為風險。關鍵在於能力研發和監督能力是否同步增長,以及當代理人開始選擇研究方向、委派子任務時,人類是否仍掌握明確的停止條件。

100%的監控覆蓋並不等於100%能發現問題,安全算力佔比也並非安全成果。

Anthropic 將代理監督分為在線與離線兩層。在線監控在動作執行前進行檢查,針對複製模型權重等快速且不可逆的風險;離線監控則在事後閱讀活動,尋找可能緩慢發展、能夠補救的失配跡象。官方稱主要內部平台的代理動作100%經過在線監控,也全部進入離線系統。8月十億多次決策中約0.002%被在線監控阻止,約等於每4.7萬次一次。

離線系統每週會標記約10萬筆記錄,再由多個分類器排除誤報並進行初審,其中最高優先級的約50筆會升級為人工審查。整體上,每千筆記錄中大約有一到兩筆會進入進一步查看。較低的阻止率可以說明大多數動作未觸發規則,也可能反映監控有漏檢的情況或任務風險較低,但這並不能單獨證明代理幾乎不會越權。評估監控品質還需要公開已知攻擊被捕捉的比例、誤報率、人工複核的時延以及事後發現的漏網事件。

在算力方面,Anthropic分析了每周的工作負載,並將主要目的是提高安全性、可解釋性或系統安全性的運行歸類為安全工作。結果顯示,在AI的研發算力中,約有6%用於安全;在由AI驅動的AI的研發算力中,約有12%用於安全。公司表示採取了保守的定義:同時促進能力和安全的任務被視為一般研發,而安全分類器的另一部分可用算力則沒有計入。

即便如此,算力占比仍不能衡量安全成果。一个高效的分類器使用更少的芯片完成更多的檢查,雖然會讓算力占比下降,但卻可能提升實際的安全性;而一次大規模的前沿訓練雖然會讓算力總量大幅增加,也不代表安全團隊的規模就會突然縮小。工作標籤的設定和自動分類過程也有可能出錯,如果不同公司自行定義「安全」的標準,就很容易得到無法比較的數據結果。

這套指標真正有價值的方向,是在建立連續時間序列之後,交給獨立機構進行核驗。研發自動化可以觀察 AI 是否從輔助走向主導;監控覆蓋範圍、延遲和升級率可以觀察監督是否能夠跟上市場規模的變化;算力分配則可以觀察公司在能力與安全之間的資源選擇。這三者必須結合起來看,任何單一項都不應該成為評估安全性的唯一依據。

Anthropic 所揭露的只是實驗室內部生產過程的一角。3萬個代理說明 AI 已經深入研發階段,但並不等於有3萬名獨立的研究人員;十億次監控決策說明監督規模巨大,但並不等於沒有漏檢;6%的安全算力說明資源可以被分類,但並不等於風險已經得到解決。下一步更重要的は、統一定義、定期更新、第三方驗證,以及在指標惡化時明確會觸發什麼限制。只有數字才能改變決策,透明度才不只是一次性的展示。

打賞
$0
點讚
0
收藏
0
瀏覽量 75
WalletJYS提醒,請廣大讀者理性看待區塊鏈,切實提高風險意識,警惕各類虛擬代幣發行與炒作,站內所有內容僅係市場資訊或相關方觀點,不構成任何形式的投資建議。如發現站內內容含敏感資訊,可點擊“舉報”,我們會及時處理。
提交
評論 0
最熱
最新
還沒有人評論喔~快搶沙發吧!
相關閱讀
美國8月只有4個州顯著增加崗位:全國失業率穩定在4.1%,地方冷熱差卻繼續擴大
美國8月新增16.2萬個非農崗位,表面上看仍是一張穩健的全國成績單。但美國勞工統計局9月18日公布的州級數據卻顯示,增長並不普遍:只有加利福尼亞、威斯康星、南卡羅來納和新墨西哥四個州的非農就業出現統計上顯著增加,其餘46個州和哥倫比亞特區基本沒有顯著變化。
币百科
·2026-09-21 09:53:22
39
英國2025年按揭成交回升16.2%:首購者佔比過半,卻需用更高槓杆換取入場券
英國住房市場在2025年明顯回暖。英國國家統計局9月18日發布的新統計顯示,全年完成717,519筆按揭購房,較2024年的617,295筆增加約16.2%,為2021年以來最高。不過,成交量仍比2006年低34.5%。市場從高利率衝擊中恢復,並不等於已經回到金融危機前的活躍程度。
币百科
·2026-09-21 09:52:22
39
Aave討論將機構託管資產變成鏈上抵押品:CoCT能同步餘額,卻無法消除託管人風險
Aave 治理论坛正在討論一項機構託管抵押借貸方案。該提案計劃為 Aave V4 部署一個隔離的 Liquidity Hub 和一條 Spoke:機構借款者將資產存放在 Anchorage 託管處,由 Chainlink 設計的 CustodySync 根據託管餘額鑄造不可轉讓的 Custodied Collateral Token,也就是 CoCT;借款者再將 CoCT 作為鏈上抵押品,從隔離資金池借出穩定幣。
币界网
·2026-09-20 09:55:49
435
歐元區7月建築產出環比持平:樓房同比下降6.4%,基礎建設回升仍托不住整體
歐盟統計局9月18日公佈,2026年7月歐元區建築業產出環比持平,歐盟整體下降0.3%。6月數據則被修訂為歐元區下降1.5%、歐盟下降1.3%。同比看,歐元區建築產出下降2.0%,歐盟下降1.8%。月度止跌並未消除年度疲弱,尤其是樓房建築仍明顯低於去年同期。
币百科
·2026-09-20 09:54:47
145
美國8月進口價格上漲0.7%:燃料價格下降,而非燃料商品卻再次推高了外部成本
美國勞工統計局9月16日公佈,8月進口價格環比上漲0.7%,扭轉了6月和7月連續下降0.3%的走勢;過去12個月累計上漲7.0%,為2022年8月以來最大同比增幅。出口價格環比上漲0.6%,7月則下降1.4%;同比增幅達到8.6%。這組數據反映跨境商品與運輸服務價格重新走高,但它不是消費者物價指數,也不能直接說成美國居民當月生活成本上漲0.7%。
币百科
·2026-09-20 09:53:45
83
查看更多