以太坊交易所 以太坊交易所
Ctrl+D 以太坊交易所
ads
首頁 > TRX > Info

a16z:機器學習和零知識證明的制衡_NAR:Canary Dollar

Author:

Time:1900/1/1 0:00:00

原文標題:Checks and balances: Machine learning and zero-knowledge proofs

原文作者:Elena Burger

原文來源:a16zcrypto

編譯:Kate, Marsbit

本文作者Elena Burger,是a16z crypto的交易合伙人,專注于游戲、NFT、web3媒體和去中心化基礎設施。在加入團隊之前,她在Gilder, Gagnon, Howe, and Co擔任了四年的股票分析師。她擁有哥倫比亞大學巴納德學院的歷史學學士學位。

在過去的幾年里,區塊鏈上的零知識證明在兩個關鍵目的上非常有用:(1)通過處理鏈下交易和驗證主網上的結果來擴展計算受限的網絡;(2)通過啟用屏蔽交易來保護用戶隱私,只有擁有解密密鑰的人才能看到。在區塊鏈的背景下,很明顯為什么這些屬性是可取的:像以太坊這樣的去中心化網絡如果沒有對驗證器處理能力、帶寬和延遲無法維持的需求(因此需要有效性Rollup),就無法增加吞吐量或區塊大小,并且所有交易對任何人都是可見的(因此需要鏈上隱私解決方案)。

但是零知識證明對于第三類功能也很有用:有效地驗證任何類型的計算是否正確運行(不僅僅是EVM鏈下實例化中的計算)。這遠遠超出了區塊鏈的范疇。

利用零知識證明的能力來簡潔地驗證計算系統的進步,現在使得用戶可以從現有的每個數字產品(最關鍵的是機器學習模型)中要求區塊鏈確保相同程度的不可信任和可驗證性。對區塊鏈計算的高需求激勵了零知識證明研究,創建了具有更小內存占用和更快證明和驗證時間的現代證明系統,使得現在可以在鏈上驗證某些小型機器學習算法。

到目前為止,我們可能都體驗過與一個極其強大的機器學習產品交互的潛力。幾天前,我使用GPT-4幫助我創建了一個在國際象棋中不斷擊敗我的AI。這感覺像是過去幾十年機器學習領域所有進步的一個縮影:IBM的開發人員花了12年時間開發出Deep Blue,一個運行在32節點IBM RS/6000 SP計算機上的模型,能夠每秒評估近2億步國際象棋,在1997年擊敗了國際象棋冠軍加里·卡斯帕羅夫(Gary Kasparov)。相比之下,我只花了幾個小時,我只編寫了很少的代碼,就編寫了一個能夠戰勝我的程序。

a16z普通合伙人James Gwertzman將于本月底辭職:1月19日消息,a16z普通合伙人James Gwertzman宣布將于本月底辭職,成為一名全職建設者。去年6月,a16z宣布推出6億美元Web3游戲基金Games Fund One,并表示James Gwertzman負責領導該基金。[2023/1/19 11:20:13]

誠然,我懷疑我創造的人工智能能否在國際象棋中擊敗Gary Kasparov,但這不是重點。關鍵是任何玩GPT-4的人都可能有類似的獲得超能力的經歷:不費什么力氣,你就可以創造出接近或超過你自己能力的東西。我們都是IBM的研究人員;我們都是Gary Kasparov。

顯然,這是令人興奮和有點令人生畏的思考。對于任何在加密行業工作的人來說,自然的沖動(在驚嘆于機器學習可以做什么之后)是考慮潛在的中心化向量,以及如何將這些向量去中心化到一個人們可以透明地審計和擁有的網絡中。目前的模型是通過吸收大量公開可用的文本和數據來構建的,但目前只有少數人控制和擁有這些模型。更具體地說,問題不是“人工智能是否具有巨大的價值”,而是“我們如何構建這些系統,使與之交互的任何人都能獲得經濟利益,如果他們愿意,還能確保他們的數據以尊重他們隱私權的方式使用。”

最近,有一種聲音呼吁暫停或減緩Chat-GPT等大型人工智能項目的進展。停止進展可能不是這里的解決方案:相反,更好的做法是推動開源模型,在模型提供者希望其權重或數據是私有的情況下,用鏈上和完全可審計的隱私保護的零知識證明來保護它們。如今,后一種圍繞私有模型權重和數據的用例在鏈上尚不可行,但零知識證明系統的進步將使其在未來成為可能。

可驗證和可擁有的機器學習

像我使用Chat-GPT構建的象棋AI在這一點上感覺相對良性:一個具有統一輸出的程序,它不會使用侵犯有價值的知識產權或侵犯隱私的數據。但是,當我們想要確保我們被告知的模型在 API 后面運行時確實是運行的模型時會發生什么?或者如果我想將經過驗證的數據提取到鏈上的模型中,并確保數據確實來自合法方?如果我想確保提交數據的“人”確實是人,而不是試圖攻擊我的網絡的機器人,該怎么辦?零知識證明,憑借其簡潔地表示和驗證任意程序的能力,是實現這一目標的一種方式。

a16z自建媒體網站Future停更兩月面臨關閉,主要編輯人員已離職:12月2日消息,著名風投a16z自建媒體網站Future面臨關閉,主要編輯人員都已經離職,包括執行主編(前CNN編輯)Maggie Leung、4年前加入a16z的總編輯Amelia Salyers、密碼學編輯(前Decrypt資深編輯)Jeff Benson以及生物學編輯Nicole Neuman。

Future于2021年6月15日上線,同時發布20多篇文章,主題從創造者經濟到加密貨幣顛覆好萊塢的潛力。其最新文章《Why Applying Machine Learning to Biology is Hard – But Worth It》發表時間為2022年10月5日,已有將近2月未發表任何文章。據Similar Web估計,Future網站今年7月的訪問量約為130萬,到9月則下降至42.3萬。[2022/12/2 21:18:45]

值得注意的是,今天,在鏈上機器學習環境中零知識證明的主要用例是驗證正確的計算。換句話說,零知識證明,更具體地說,SNARK(簡潔的非交互式知識論證),在ML上下文中因其簡潔屬性而最有用。這是因為零知識證明保護了證明者(及其處理的數據)的隱私不受窺探驗證者的侵害。像全同態加密(FHE)、功能加密或可信執行環境(TEE)這樣的隱私增強技術更適用于讓不受信任的驗證者對私有輸入數據運行計算(更深入地探索這些技術不在本文的范圍內)。

讓我們退一步,從更高層次上理解你可以用零知識表示的機器學習應用程序的類型。(要想更深入地了解ZK,請參閱我們關于零知識證明算法和硬件改進的文章,Justin Thaler關于SNARK性能的工作,或者我們的零知識標準。)零知識證明通常將程序表示為算術電路:使用這些電路,證明者從公共和私人輸入中生成一個證明,驗證者從數學上計算該語句的輸出是正確的——而不獲得關于私人輸入的任何信息。

我們仍然處于在鏈上使用零知識證明進行計算實用驗證的非常早期階段,但算法的改進正在擴大可行的范圍。以下是零知識證明在機器學習中的五種應用方式。

a16z報告:DAO最好提交法律文件并進行納稅:6月3日消息,DAO的興起引發了法律上的難題,即如何正式建立一個設計上并不真正想成為實體的實體。a16z提出了一套擬議的解決方案,并于周四發布了一份報告,稱這類群體可能更適合安頓下來并繳納美國稅款。DAO將資金鎖定在一個區塊鏈上,一組參與者可以透明地朝向某個共同目標。a16z在其最近一次為DAO建立美國法律基礎的公開努力中稱,DAO需要“不要求進行真實世界的人類活動”的結構來滿足法律要求——可能有利于非法人非營利組織(UNA)和有限責任公司(LLC)。面臨的挑戰是保持DAO的去中心化,同時允許它滿足企業或非營利組織的稅務要求和其他實際需求。

a16z總顧問兼去中心化負責人Miles Jennings和參與DAO研究小組的律師David Kerr撰寫的論文稱,使用受歡迎的離岸策略來避稅可能會大大增加全球抵制的風險。美國國內結構對擁有大量美國成員和聯系方的項目的實際好處是顯而易見的,該文件總結道,并質疑在行業等待監管的同時進入免稅司法管轄區是否真的是最佳的行動方案。(CoinDesk)[2022/6/3 4:00:07]

1. 模型真實性:你希望確保某些實體聲稱已經運行的機器學習模型確實是運行過的模型。例如,可以在 API 后面訪問模型的情況,并且特定模型的提供者有多個版本——比如,一個更便宜、不太準確的版本和一個更昂貴、性能更高的版本。如果沒有證據,你就無法知道模型的提供者是否為你提供了更便宜的模型,而你實際上已經支付了更昂貴的模型(例如,模型的提供者想要節省服務器成本并提高他們的利潤率)。

要做到這一點,你需要為模型的每個實例化單獨的證明。實現這一目標的一種實用方法是通過Dan Boneh、Wilson Nguyen和Alex Ozdemir的功能承諾框架,這是一種基于SNARK的零知識承諾方案,允許模型所有者向模型提交數據,用戶可以將數據輸入模型并收到已提交模型已運行的驗證。一些構建在Risc Zero(一種基于 STARK 的通用虛擬機)上的應用程序也支持這一點。Daniel Kang、Tatsunori Hashimoto、Ion Stoica和Yi Sun進行的其他研究已經證明,可以驗證ImageNet數據集上的有效推斷,準確率為92%(與性能最高的非ZK驗證ImageNet模型相當)。

a16z合伙人反駁Jack Dorsey:VC對Web3產品的掌控非常有限:12月21日消息,a16z合伙人ChrisDixon在社交媒體上回應Jack Dorsey針對Web3的相關言論時表示,在Web3中,所有代碼、數據和所有權都是開源的,風投(包括a16z)擁有的很少。ChrisDixon同時表示,其本身是JackDorsey的超級粉絲,希望我們最終可以將他帶到ETH和其他區塊鏈,BTC作為數字黃金很棒,但還有很多重要的應用程序需要其他鏈。此前報道,Jack Dorsey今日在社交媒體上發文表示,用戶并不實際擁有Web3產品,Web3的實際擁有者是項目背后的風投機構(VC)及其有限合伙人(LP),Web3永遠不能脫離他們設定的激勵機制。最終,Web3將是一個帶有不同標簽的中心化實體。[2021/12/21 7:53:14]

但是僅僅收到提交的模型已經運行的證據是不夠的。模型可能不能準確地表示給定的程序,因此希望提交的模型由第三方進行審計。功能承諾允許證明者確定它使用了一個已提交的模型,但它們不能保證關于已提交模型的任何內容。如果我們能夠使零知識證明具有足夠的可執行性來證明訓練(參見下面的示例#4),那么有一天我們也可以開始得到這些保證。

2. 模型完整性:你希望確保相同的機器學習算法以相同的方式在不同用戶的數據上運行。這在你不希望應用任意偏見的領域非常有用,例如信用評分決策和貸款申請。你也可以使用功能承諾。為此,你將提交一個模型及其參數,并允許人們提交數據。輸出將驗證模型是否使用每個用戶數據的提交參數運行。或者,模型及其參數可以公開,用戶自己可以證明他們將適當的模型和參數應用于他們自己的(經過身份驗證的)數據。這在醫療領域可能特別有用,因為法律規定患者的某些信息必須保密。在未來,這可能會使醫療診斷系統能夠從完全私密的實時用戶數據中學習和改進。

3.證明:你希望將來自外部經過驗證的各方(例如,任何可以產生數字簽名的數字平臺或硬件)的證明集成到一個模型或任何其他類型的鏈上運行的智能合約中。為此,你將使用零知識證明來驗證簽名,并將該證明用作程序的輸入。Anna Rose和Tarun Chitra最近與Daniel Kang和Yi Sun一起主持了一集零知識播客,探討了這一領域的最新進展。

a16z合伙人:NFT用戶群即將爆發:11月15日消息,a16z合伙人Katie Haun接受TechCrunch采訪時表示,NFT目前較為集中的用戶群即將迎來爆發,這將極大地改變消費者和內容創作者的互聯網商業模式。NFT能讓消費者擺脫對平臺的依賴,即便平臺(比如游戲)關閉,用戶仍能將相關益處轉移至其他平臺。內容創作者可對數字商品進行編程,以便在未來的交易中持續獲得財務收益,同時消除中間商抽成。目前該技術還處于早期階段,有很多NFT被用于炫富目的,她認為未來會有更多現實世界中的基本商品以數字方式開發。(TechCrunch)[2021/11/15 6:52:09]

具體來說,Daniel和Yi最近發布了一項工作,研究如何驗證由經過驗證的傳感器拍攝的圖像是否經過裁剪、調整大小或有限的編輯等轉換——這在你想證明圖像不是深度偽造而是經過某種合法形式的編輯的情況下很有用。Dan Boneh和Trisha Datta也做了類似的工作,使用零知識證明來驗證圖像的來源。

但是,更廣泛地說,任何經過數字認證的信息都可以進行這種形式的驗證:正在研究EZKL庫的Jason Morton(下一節將詳細介紹)將其稱為“給區塊鏈眼睛”。任何簽名的端點:(例如,Cloudflare的SXG服務,第三方公證員)都會生成可驗證的數字簽名,這對于證明來自受信任方的出處和真實性非常有用。

4. 去中心化推理或訓練:你希望以去中心化的方式進行機器學習推理或訓練,并允許人們向公共模型提交數據。要做到這一點,你可以在鏈上部署一個已經存在的模型,或者構建一個全新的網絡,并使用零知識證明來壓縮模型。Jason Morton的EZKL庫正在創建一種方法,用于提取ONXX和JSON文件,并將它們轉換為ZK-SNARK電路。最近在ETH Denver的演示表明,這可以用于創建基于圖像識別的鏈上尋寶游戲等應用程序,其中游戲的創造者可以上傳照片,生成圖像的證明,玩家可以上傳圖像;驗證者檢查用戶上傳的圖像是否與創建者生成的證明充分匹配。EZKL現在可以驗證多達1億個參數的模型,這意味著它可以用于在鏈上驗證ImageNet大小的模型(有6000萬個參數)。

其他團隊,如Modulus Labs正在對不同的證明系統進行鏈上推理的基準測試。Modulus的基準運行高達1800萬個參數。在訓練方面,Gensyn正在構建一個去中心化的計算系統,用戶可以輸入公共數據,并通過一個去中心化的節點網絡來訓練他們的模型,并驗證訓練的正確性。

5. 身份證明:你想要在不損害他們隱私的情況下驗證某人是獨一無二的人。為此,你需要創建一種驗證方法——例如,生物識別掃描,或以加密方式提交政府ID的方法。然后,你將使用零知識證明來檢查某人是否已被驗證,而不透露有關該人身份的任何信息,無論該身份是完全可識別的,還是像公鑰那樣的假名。

Worldcoin通過他們的身份證明協議來做到這一點,這是一種通過為用戶生成唯一的虹膜代碼來確保抗女巫攻擊的方法。至關重要的是,為WorldID創建的私鑰(以及為Worldcoin用戶創建的加密錢包的其他私鑰)與項目的眼睛掃描球在本地生成的虹膜代碼完全分離。這種分離完全將生物識別標識與任何形式的用戶密鑰分離開來,這些密鑰可能來自于一個人。Worldcoin還允許應用程序嵌入一個SDK,允許用戶使用WorldID登錄,并利用零知識證明保護隱私,允許應用程序檢查該人是否擁有WorldID,但不支持個人用戶跟蹤(更多細節,請參閱這篇文章)。

這個例子是用零知識證明的隱私保護特性來對抗更弱、更惡意的人工智能形式的一種形式,所以它與上面列出的其他例子有很大的不同(例如,證明你是一個真正的人,而不是一個機器人,而不透露任何關于你自己的信息)。

模型架構和挑戰

實現SNARK(簡潔的非交互式知識論證)的證明系統的突破是將許多機器學習模型放在鏈上的關鍵驅動因素。一些團隊正在現有的架構(包括Plonk、Plonky2、Air等)中制作定制電路。在自定義電路方面,Halo 2已經成為Daniel Kang和Jason Morton的EZKL項目等在工作中使用的流行后端,。Halo 2的證明時間是準線性的,證明大小通常只有幾千字節,驗證時間是常數。也許更重要的是,Halo 2擁有強大的開發人員工具,使其成為開發人員使用的流行SNARK后端。其他的團隊,比如Risc Zero,則致力于一個通用的VM策略。其他人正在使用Justin Thaler基于求和校驗協議的超高效證明系統創建自定義框架。

證明生成和驗證時間絕對取決于生成和檢查證明的硬件,以及生成證明的電路的大小。但這里需要注意的關鍵是,無論所表示的程序是什么,證明的大小總是相對較小,因此驗證者檢查證明的負擔是有限的。然而,這里有一些微妙之處:對于像Plonky2這樣使用基于FRI的承諾方案的證明系統,證明大小可能會增加。(除非它被包裝在一個基于配對的SNARK中,如Plonk或Groth16,它們的大小不會隨著語句的復雜性而增長。)

這里機器學習模型的含義是,一旦你設計了一個證明系統,準確地表示一個模型,實際驗證輸出的成本將非常便宜。開發人員必須考慮最多的事情是證明時間和內存:以一種可以相對快速地證明模型的方式表示模型,并且理想的證明大小在幾千字節左右。為了證明機器學習模型在零知識下的正確執行,你需要對模型架構(層、節點和激活函數)、參數、約束和矩陣乘法操作進行編碼,并將它們表示為電路。這涉及到將這些屬性分解為可以在有限域上執行的算術運算。

該領域仍處于起步階段。在將模型轉換為電路的過程中,準確性和保真度可能會受到影響。當一個模型被表示為一個算術電路時,那些前面提到的模型參數、約束和矩陣乘法操作可能需要近似和簡化。當算術運算被編碼為證明的有限域中的元素時,一些精度可能會丟失(或者在沒有這些優化的情況下,使用當前的零知識框架生成證明的成本將高得離譜)。此外,為了精確起見,機器學習模型的參數和激活通常被編碼為32位,但今天的零知識證明不無法在沒有大量開銷的情況下以必要的算術電路格式表示32位浮點運算。因此,開發人員可以選擇使用量化的機器學習模型,其32位整數已經轉換為8位精度。這些類型的模型有利于表示為零知識證明,但被驗證的模型可能是高質量初始模型的粗略近似。

在這個階段,無可否認,這是一場追趕游戲。隨著零知識證明變得更加優化,機器學習模型的復雜性也在增長。已經有許多有前景的優化領域:證明遞歸可以通過允許證明用作下一個證明的輸入來減少整體證明的大小,解鎖證明壓縮。也有一些新興的框架,比如Linear A的Apache張量虛擬機(TVM)的分支,它改進了一個轉譯器,用于將浮點數轉換為零知識友好的整數表示。最后,我們a16z crypto樂觀地認為,未來的工作將使在SNARK中表示32位整數變得更加合理。

“規模”的兩種定義

零知識證明可通過壓縮進行擴展:SNARK允許你使用一個極其復雜的系統(虛擬機、機器學習模型),并以數學方式表示它,以便驗證它的成本小于運行它的成本。另一方面,機器學習通過擴展來擴展:今天的模型隨著更多的數據、參數和GPU/TPU參與訓練和推理過程而變得更好。中心化的公司可以以幾乎不受限制的規模運行服務器:按月收取API調用費用,并支付運營成本。

區塊鏈網絡的經濟現實幾乎以相反的方式運行:鼓勵開發人員優化他們的代碼,使其在計算上可行(并且便宜)。這種不對稱有一個巨大的好處:它創造了一個證明系統需要變得更有效的環境。我們應該推動在機器學習中要求區塊鏈提供同樣的好處——即可驗證的所有權和共享的真理概念。

雖然區塊鏈激勵了zk-SNARK的優化,但計算的每個領域都將受益。

MarsBit

媒體專欄

閱讀更多

金色財經 善歐巴

Chainlink預言機

金色早8點

白話區塊鏈

Odaily星球日報

Arcane Labs

歐科云鏈

深潮TechFlow

BTCStudy

Tags:區塊鏈ARKNARWEB區塊鏈的未來發展前景論文DARK價格Canary DollarWEB價格

TRX
人類精英呼吁暫停AI實驗 ChatGPT:合理但謹慎考慮_ATG:GPT

3月29日,非營利組織“未來生命研究所(Future of Life Institute)”發表了一封題為“暫停巨型AI實驗”的公開信.

1900/1/1 0:00:00
詳解以太坊POS工作原理:Epoch、Slot與信標區塊_MIX:draco幣兌換wemix實時

使用權益證明的以太坊的獨特性在于參與者數量的最大化設計。它允許成百上千和成千上萬的驗證者活躍地參與決策過程。在筆者撰文時已經有大約 50 萬的驗證者實體(從協議的角度而言)在活躍地參與這個過程.

1900/1/1 0:00:00
將鏈外數據喂給鏈上 是催生區塊鏈往更復雜的生態進行演化的動力_LINK:tBTC

早在2016年,consensys就試圖將比特幣和以太坊這兩條區塊鏈連接起來,開發了BTC Relay這個項目,實現讓以太坊鏈能夠知曉比特幣的特定交易,從而實現了在無需托管BTC的前提下.

1900/1/1 0:00:00
金色Web3.0日報 | 以太坊再質押協議EigenLayer 發布第一階段測試網_區塊鏈:NFT

DeFi數據 1、DeFi代幣總市值:513.3億美元 DeFi總市值及前十代幣 數據來源:coingecko2、過去24小時去中心化交易所的交易量27.

1900/1/1 0:00:00
Arthur Hayes:囤了那么久的 $LDO 我為何全部虧本拋售?_IDO:LID

最近,加密研究員 Thor Hartvigsen 總結了過去 30 天內一些知名風險投資基金、大型投資者以及交易員在加密貨幣市場上的活動.

1900/1/1 0:00:00
模塊化與加密貨幣的“下一個10億用戶”_BIT:以太坊

原文:lattice 摘要: 由于需要直接與基本協議層(L1s)進行交互,構建和使用加密貨幣仍然非常困難.

1900/1/1 0:00:00
ads