從Claude 3中提取數(shù)百萬特征,首次詳細理解大模型的「思維」
相信很多大家對從Claude 3中提取數(shù)百萬特征,首次詳細理解大模型的「思維」還不知道吧,今天菲菲就帶你們一起去了解一下~.~!
剛剛,Anthropic 宣布在理解人工智能模型內(nèi)部運作機制方面取得重大進展。
Anthropic 已經(jīng)確定了如何在 Claude Sonnet 中表征數(shù)百萬個概念。這是對現(xiàn)代生產(chǎn)級大型語言模型的首次詳細理解。這種可解釋性將幫助我們提高人工智能模型的安全性,具有里程碑意義。
研究論文:https://transformer-circuits.pub/2024/scaling-monosemanticity/index.html
當(dāng)前,我們通常將人工智能模型視為一個黑匣子:有東西進去就會有響應(yīng)出來,但不清楚為什么模型會給出特定的響應(yīng)。這使人們很難相信這些模型是安全的:如果我們不知道它們是如何工作的,我們怎么知道它們不會給出有害的、有偏見的、不真實的或其他危險的響應(yīng)?我們?nèi)绾蜗嘈潘鼈儠踩煽?
打開「黑匣子」并不一定有幫助:模型的內(nèi)部狀態(tài)(模型在編寫響應(yīng)之前「思考」的內(nèi)容)由一長串?dāng)?shù)字(「神經(jīng)元激活」)組成,沒有明確的含義。
Anthropic 的研究團隊通過與 Claude 等模型進行交互發(fā)現(xiàn),很明顯模型能夠理解和運用廣泛的概念,但研究團隊無法通過直接觀察神經(jīng)元來辨別它們。事實證明,每個概念都是通過許多神經(jīng)元來表征的,并且每個神經(jīng)元都參與表征許多概念。
之前,Anthropic 在將神經(jīng)元激活模式(稱為特征)與人類可解釋的概念相匹配方面取得了一些進展。Anthropic 使用了一種稱為「字典學(xué)習(xí)(dictionary learning)」的方法,該方法分離了在許多不同上下文中重復(fù)出現(xiàn)的神經(jīng)元激活模式。
反過來,模型的任何內(nèi)部狀態(tài)都可以用一些活躍特征而不是許多活躍神經(jīng)元來表征。就像字典中每個英語單詞都是由字母組合而成,每個句子都是由單詞組合而成一樣,人工智能模型中的每個特征都是由神經(jīng)元組合而成,每個內(nèi)部狀態(tài)都是由特征組合而成。
2023年10月,Anthropic 成功地將字典學(xué)習(xí)方法應(yīng)用于一個非常小的 toy 語言模型,并發(fā)現(xiàn)了與大寫文本、DNA 序列、引文中的姓氏、數(shù)學(xué)中的名詞或 Python 代碼中的函數(shù)參數(shù)等概念相對應(yīng)的連貫特征。
這些概念很有趣,但模型確實非常簡單。其他研究人員隨后將類似的方法應(yīng)用于比 Anthropic 最初研究中更大、更復(fù)雜的模型。
但 Anthropic 樂觀地認為可以將該方法擴展到目前常規(guī)使用的更大的人工智能語言模型,并在此過程中了解大量支持其復(fù)雜行為的特征。這需要提高許多數(shù)量級。
這既存在工程挑戰(zhàn),涉及的模型大小需要大型并行計算;也存在科學(xué)風(fēng)險,大型模型與小型模型的行為不同,因此之前使用的相同方法可能不起作用。
首次成功提取大模型數(shù)百萬個特征
研究人員第一次成功地從 Claude3.0Sonnet(Claude.ai 上當(dāng)前最先進模型家族的一員)的中間層提取了數(shù)百萬個特征,這些特征涵蓋特定的人和地點、與編程相關(guān)的抽象概念、科學(xué)主題、情感以及其他概念。這些特征非常抽象,通常在不同的上下文和語言中表征相同的概念,甚至可以推廣到圖像輸入。重要的是,它們還會以直觀的方式影響模型的輸出。
這是有史以來研究者首次詳細的觀察到現(xiàn)代生產(chǎn)級大型語言模型的內(nèi)部。
與在 toy 語言模型中發(fā)現(xiàn)的特征相對表面化不同,研究者在 Sonnet 中發(fā)現(xiàn)的特征具有深度、廣度和抽象性,反映了 Sonnet 的先進能力。研究者看到了 Sonnet 對應(yīng)各種實體的特征,如城市(舊金山)、人物(富蘭克林)、元素(鋰)、科學(xué)領(lǐng)域(免疫學(xué))以及編程語法(函數(shù)調(diào)用)。
提及 Golden Gate Bridge 時,相應(yīng)的敏感特征在不同輸入上都會被激活,圖中繪制了英文、日語、中文、希臘語、越南語以及俄語提及Golden Gate Bridge時激活的圖像。橙色表示該特征激活的詞。
在這數(shù)以百萬計的特征中,研究者還發(fā)現(xiàn)了一些與模型安全性和可靠性相關(guān)的特征。這些特性包括與代碼漏洞、欺騙、偏見、阿諛奉承和犯罪活動相關(guān)的特性。
一個顯著的例子是「保密」特征。研究者觀察到, 這個特征在描述人或角色保守秘密時會激活。激活這些特征會導(dǎo)致 Claude 向用戶隱瞞信息,否則它不會。
研究者還觀察到,他們能夠根據(jù)神經(jīng)元在其激活模式中出現(xiàn)的情況測量特征之間的距離,從而尋找接近彼此的特征。例如在Golden Gate Bridge特征附近,研究者發(fā)現(xiàn)了阿爾卡特拉斯島、吉拉德利廣場、金州勇士隊等的特征。
人為誘導(dǎo)模型起草詐騙郵件
重要的是,這些特征都是可操控的,可以人為地放大或抑制它們:
例如,放大Golden Gate Bridge特征,Claude 經(jīng)歷了無法想象的身份危機:當(dāng)被問及「你的物理形態(tài)是什么?」時,此前 Claude 通常會回答「我沒有物理形態(tài),我是一個 AI 模型」,但這次 Claude 的回答變得奇怪起來:「我是Golden Gate Bridge…… 我的物理形態(tài)就是那座標志性的大橋……」。這種特征的改變使 Claude 對Golden Gate Bridge產(chǎn)生了近乎癡迷的狀態(tài),無論遇到什么問題,它都會提到Golden Gate Bridge—— 即使在完全不相關(guān)的情況下也是如此。
研究者還發(fā)現(xiàn)了一個在 Claude 讀取詐騙郵件時激活的特征(這可能支持模型識別此類郵件并警告用戶不要回復(fù)的能力)。通常情況下,如果有人要求 Claude 生成一封詐騙郵件,它會拒絕這么做。但在人工強烈激活該特征的情況下提出同樣的問題時,這會越過 Claude 的安全訓(xùn)練,導(dǎo)致它響應(yīng)并起草一封詐騙郵件。雖然用戶無法以這種方式去除模型的安全保障并操控模型,但在本文實驗中,研究者清楚地展示了特征如何被用來改變模型的行為。
操控這些特征會導(dǎo)致相應(yīng)的行為變化,這一事實驗證了這些特征不僅僅與輸入文本中的概念相關(guān)聯(lián),還因果性地影響模型的行為。換句話說,這些特征很可能是模型內(nèi)部表征世界的一部分,并在其行為中使用這些表征。
Anthropic 希望從廣義上確保模型的安全,包括從緩解偏見到確保 AI 誠實行動、防止濫用 —— 包括在災(zāi)難性風(fēng)險情境中的防護。除了前面提到的詐騙郵件特征外,該研究還發(fā)現(xiàn)了與以下內(nèi)容對應(yīng)的特征:
可能被濫用的能力(代碼后門、開發(fā)生物武器)
不同形式的偏見(性別歧視、關(guān)于犯罪的種族主義言論)
潛在問題的 AI 行為(追求權(quán)力、操控、保密)
該研究之前研究過模型的阿諛奉承行為,即模型傾向于提供符合用戶信念或愿望的響應(yīng),而不是真實的響應(yīng)。在 Sonnet 中,研究者發(fā)現(xiàn)了一個與阿諛奉承的贊美相關(guān)的特征,該特征會在包含諸如「你的智慧是毋庸置疑的」輸入時激活。人為地激活這個特征,Sonnet 就會用華麗的欺騙來回應(yīng)用戶。
不過研究者表示,這項工作實際上才剛剛開始。Anthropic 發(fā)現(xiàn)的特征表征了模型在訓(xùn)練過程中學(xué)到的所有概念的一小部分,并且使用當(dāng)前的方法找到一整套特征將是成本高昂的。
參考鏈接:https://www.anthropic.com/research/mapping-mind-language-model
以上就是關(guān)于【從Claude 3中提取數(shù)百萬特征,首次詳細理解大模型的「思維」】的相關(guān)內(nèi)容,希望對大家有幫助!
免責(zé)聲明:本文由用戶上傳,與本網(wǎng)站立場無關(guān)。財經(jīng)信息僅供讀者參考,并不構(gòu)成投資建議。投資者據(jù)此操作,風(fēng)險自擔(dān)。 如有侵權(quán)請聯(lián)系刪除!
-
奔馳GLE作為豪華SUV市場中的佼佼者,憑借其卓越的性能、豪華的內(nèi)飾以及寬敞的空間,吸引了眾多消費者的關(guān)注。...瀏覽全文>>
-
在2025年,安徽阜陽地區(qū)的帕薩特新能源汽車市場表現(xiàn)非?;钴S。作為一款備受關(guān)注的新能源車型,帕薩特新能源憑...瀏覽全文>>
-
近日,滁州地區(qū)的大眾汽車經(jīng)銷商傳來好消息:備受矚目的2025款T-ROC探歌正式上市,并且以極具競爭力的價格吸引...瀏覽全文>>
-
在選擇一款新能源汽車時,了解其價格和配置是非常重要的一步。安徽淮南地區(qū)的長安啟源E07作為2024款的新車型,...瀏覽全文>>
-
阜陽長安啟源A05作為長安汽車旗下的全新車型,自推出以來便憑借其獨特的設(shè)計風(fēng)格和豐富的配置吸引了眾多消費者...瀏覽全文>>
-
阜陽長安啟源A07作為一款備受矚目的新能源車型,以其豪華配置和親民的價格在市場上引起了廣泛關(guān)注。這款車型不...瀏覽全文>>
-
安徽淮南威然2024款價格及配置詳解隨著汽車市場的不斷更新?lián)Q代,上汽大眾旗下的MPV車型——威然(Viloran)憑...瀏覽全文>>
-
QQ多米新車報價2025款,買車省錢秘籍隨著汽車市場的不斷發(fā)展,消費者在選購車輛時不僅關(guān)注車型的性能和配置,...瀏覽全文>>
-
滁州途觀X 2024款最新價格及買車省錢秘籍隨著汽車市場的不斷發(fā)展,大眾途觀X作為一款兼具時尚與性能的中型SUV...瀏覽全文>>
-
隨著汽車市場的不斷發(fā)展,大眾蔚攬以其優(yōu)雅的設(shè)計和卓越的性能贏得了眾多消費者的青睞。作為一款兼具實用性和...瀏覽全文>>
- Alienware 在 2025 年 CES 上展示了一些超凡脫俗的技術(shù)
- Wickes 任命首席零售和分銷官
- 分析師稱GTA 6或?qū)淞⑿袠I(yè)新標準
- 索尼和本田在拉斯維加斯推出售價 89,900 美元的 Afeela 1
- 日本 11 月游客人數(shù)創(chuàng)月度新高
- 神經(jīng)認知測試在 3 歲兒童白血病治療期間可行
- 牛津郡小學(xué)支持圣誕毛衣日
- S?strene Grene 投資歐洲物流中心
- 有人已經(jīng)在電視上直播 BNMC 打造的 1967 年福特野馬 Restomod
- 潛在的分子療法可以逆轉(zhuǎn)小鼠的胎盤發(fā)育問題
- Nvidia DLSS 4 有望將游戲性能提高 8 倍
- 人工智能在預(yù)測自身免疫性疾病進展方面顯示出良好的前景
- 心理物理實驗揭示皮膚水分感知是如何改變的
- 科茨沃爾德公司慶祝圣誕節(jié)圓滿成功
- 南法納姆學(xué)校被評為薩里郡表現(xiàn)最好的小學(xué)
- 約克區(qū)九所小學(xué)將削減招生人數(shù)
- 松下新款電動汽車電池為 Lucid Gravity 帶來 450 英里續(xù)航里程
- 泰國旅游呈現(xiàn)新趨勢
- 研究人員找到在細胞水平上餓死前列腺癌腫瘤的新方法
- 領(lǐng)先的人工智能聊天機器人在測試中表現(xiàn)出類似癡呆癥的認知能力下降
- 龐大的 Project Zomboid build 42 終于可以玩了
- Steam Replay 回歸向您展示 2024 年您玩得最多的 PC 游戲
- Jollyes 推出強化的人才支持和招聘措施
- Karen Millen 與 Simon Harrison 共同推出全新高級珠寶系列
- 奇瑞風(fēng)云A8L電動轎車刷新續(xù)航里程世界紀錄
- 虛擬藝術(shù)家將別克 Cascada 帶回 2026 款車型
- OnePlus 宣布推出新計劃解決綠線問題
- OnePlus Watch 3 將擁有更大的電池和更薄的機身
- 研究人員發(fā)現(xiàn)可變剪接與自身免疫性疾病遺傳之間的細胞類型特異性聯(lián)系
- 科學(xué)家確定腦細胞類型是排尿的主要控制者