從 deepfakes 到 DNA:為 AI 加上浮水印的科學


🏦 台灣Pay 銀行轉帳 💙 PayPal
SynthID 如何為 AI 生成的文字、影像與蛋白質加上隱形浮水印
- 00:00 主持人 Hannah Fry 開場:AI 生成文字、影像、音訊、影片越來越好,「這是真的嗎?」成為這個時代最棘手的問題之一。
- 17:12 實際應用:記者用 SynthID 檢查流傳的影像,例如 California 大火中奇蹟般完好的房子、Iran 戰爭的影像,偵測出是 AI 生成。
- 36:45 Jeremy:他們不是最早做浮水印的,但就其所知,是最早同時展示不可察覺性與功能保留,並包含 in vitro 實驗室結果的團隊。
💡 你可以怎麼用:看到可疑圖片時,可以丟進 Gemini app 問它是不是 AI 生成的。但要記得它只查得出 Google 模型做的圖,「沒查到」不等於「是真的」;短文字和別家不分享金鑰的內容也一樣查不出來。
看全部 66 條重點
🧑🏫 這支影片是 Google DeepMind 的人說明 SynthID:一種把看不見的記號藏進 AI 產出內容的技術,用來事後查出「這是不是 AI 做的、哪個 AI 做的」。它從假圖、假文章一路講到 AI 設計的蛋白質,值得看的是你會知道這種偵測的原理,也知道它目前做不到什麼。
- 00:00 主持人 Hannah Fry 開場:AI 生成文字、影像、音訊、影片越來越好,「這是真的嗎?」成為這個時代最棘手的問題之一。↳ AI 做的文字、圖片、聲音、影片已經逼真到肉眼難分,「這是不是真的」變成每個人每天都會碰到的難題。
- 00:31 AI 已能設計自然界從未存在的生物分子與結構,其中有些可能被設計來造成傷害;解法可能是隱形嵌入內容或分子中的浮水印。↳ 問題不只在假圖假影片。AI 也能設計自然界沒有的生物分子,有些可能被拿來害人。影片提的解法是 watermark(浮水印),也就是藏在內容或分子裡、人看不到的訊號。
- 01:03 來賓:Pushmeet Kohli 是 Google DeepMind 的 VP of Science、SynthID 的設計者之一;Jeremy Ratcliffe 是生物安全研究員,其團隊把同一技術用到生物學。↳ 兩位來賓一位是 SynthID(Google DeepMind 的浮水印系統)的設計者之一,一位是研究生物安全的人,他的團隊把同一套方法搬到生物領域。
- 01:34 生物學做浮水印的動機是 provenance(來源):分辨序列來自自然界還是 AI 系統的產物。↳ provenance 就是「這東西從哪來」。在生物學上要回答的是:這段序列是自然界本來就有的,還是 AI 設計出來的。
- 01:34 擔心的風險:AI 生成的序列可能具有已知有問題的性質,但光從序列本身看不出來。↳ 麻煩在於 AI 設計的序列可能帶有已知有害的特性,但光看那串字母看不出來,像一份外表正常的危險配方。
- 02:04 Jeremy 認為好浮水印的條件:人類無法察覺(否則很容易被抹除)、高可偵測性、良好的通用性(不必為每種資料型態量身訂做)。↳ 好浮水印要符合三點:人看不出來(看得出來就容易被抹掉)、機器一查就查得到、同一套方法能通用,不必每種資料重新設計。
- 02:34 Pushmeet:DeepMind 的浮水印計畫幾乎是八年前開始的,目的是讓使用者對所見內容有來源感。↳ 這不是最近才追流行的題目。DeepMind 將近八年前就開始做,出發點是讓人看到內容時知道它的來歷。
- 03:39 Pushmeet 的三個需求:不降低品質(否則沒人用)、對攻擊或轉換具穩健性(改動訊號後仍存在)、容易使用(容易嵌入也容易偵測)。↳ 另一位來賓的三個要求:加了不能讓內容變差,不然沒人肯用;被修改、轉檔後記號還在;加記號和查記號都要簡單。
- 04:11 歸納為三個性質:imperceptibility、robustness、scalability,所有浮水印系統都依此設計。↳ 兩人的說法歸成三個詞:imperceptibility(看不出來)、robustness(改過還在)、scalability(能大規模用)。這是所有浮水印系統的設計標準。
- 04:44 過去修圖軟體變精密時,有專門系統分析影像中被竄改留下的微小差異來判斷真偽。↳ 以前抓修圖的做法是找破綻:修過的地方會留下細微的不自然痕跡,專門的系統靠這些痕跡判斷真假。
- 05:17 隨著生成式 AI 更精密,那些微小差異消失了;浮水印的做法是主動在內容裡注入訊號(偏差),即使模型完美也能事後偵測。↳ AI 越做越好,破綻沒了,等著找破綻這條路走不通。浮水印反過來,在生成當下就主動放進記號,內容再完美也查得到。
- 06:20 團隊先從影像做起,因為大家擔心影像被用於假新聞與錯誤資訊。↳ 團隊先做影像,因為當時大家最擔心的是假照片被拿去做假新聞、散布錯誤訊息。
- 06:51 影像資料量大:一張 one megapixel 影像約有 1 million 或 3 million 個數字(視編碼而定)可用來藏資訊而不改變內容。↳ 影像好藏東西。一張一百萬畫素的圖由上百萬個數字組成,稍微動其中一些,人眼看不出差別,空間很大。
- 07:26 文字不像影像那樣高維,只有少少幾個字,還必須小心不改變意思,所以文字浮水印的方法與影像、影片、音訊的很不一樣。↳ 文字就難了。一段話只有幾個字,動一個字意思可能就變了,所以文字浮水印得用跟影像、影音完全不同的方法。
- 07:57 主持人指出浮水印已被納入法律:EU 境內的生成式內容必須有某種浮水印。↳ 這已經不只是技術選項。主持人提到歐盟已把浮水印寫進法律,在歐盟境內的 AI 生成內容必須帶有某種浮水印。
- 08:27 浮水印被視為可擴展的穩健解法;SynthID 已被 Nvidia 採用,也有 OpenAI 等合作夥伴採用。↳ 業界把浮水印看成能大量使用又夠牢靠的做法。SynthID 不只 Google 自己用,Nvidia 採用了,OpenAI 等夥伴也採用。
- 08:58 生物版與文字版原理相似,Jeremy 的團隊直接使用開源的 SynthID text library 嵌入另一個系統,再在上面做調整。↳ 生物版沒有從零開始。團隊直接拿公開的 SynthID 文字版程式來用,接到另一個系統上再調整,因為兩者原理很像。
- 09:58 傳統偵測法是訓練機器學習模型做分類,用大量資料區分模型生成與自然世界取得的內容。↳ 傳統偵測法是訓練一個 classifier(分類器,專門判斷「AI 寫的還是人寫的」的模型),餵它大量兩邊的例子讓它學著分。
- 10:30 早期大型語言模型有明顯的「tells」,例如「It's not X, it's Y」句型、過度使用 quietly 這個字。↳ 早期 AI 寫的東西有明顯口頭禪,影片稱為 tells(露餡的習慣),例如愛用「不是 X,而是 Y」句型,或一直用 quietly 這個字。
- 11:00 模型越精密,這些 tells 越少,分類器的準確度會隨時間下降。↳ 模型進步後這些口頭禪越來越少,靠抓習慣的分類器就越來越不準。這是它先天的弱點。
- 11:30 文字浮水印原理:大型語言模型對下一個 token(字)有一個機率分布,可以選擇不同的字。↳ 文字浮水印的基礎:AI 寫字是一個 token(一小段字詞)接一個地挑,每一步都有好幾個候選字,各有不同機率。
- 12:01 例子:被問早餐吃什麼,可用「I」開頭,也可用「Pushmeet」開頭;當選項同樣合理時就有選擇空間,浮水印依 key 的指示來選。↳ 例如回答早餐吃什麼,用「我」開頭或用名字開頭都通順。這種怎麼選都行的地方,就交給一把 key(金鑰)決定選哪個。
- 12:33 背後有一把 secret key 讓某些字被偏好;偵測器利用的不是特定字重複,而是這些字出現的模式。↳ secret key 是一組保密的規則,讓某些字稍微比較常被選中。偵測時不是找某個字有沒有重複,而是看整篇的選字規律合不合這把金鑰。
- 13:03 若不同 AI 模型使用不同的 key,只要握有 key,就能檢查內容是由哪個模型生成的。↳ 每家 AI 用不同金鑰的話,手上有金鑰的人不只能查出是不是 AI 寫的,還能查出是哪一個模型寫的。
- 13:34 限制:很短的文字無法加浮水印,例如「法國首都是什麼?是 Paris」,幾乎沒有可改動之處。↳ 太短的文字加不了。像「法國首都是巴黎」這種答案幾乎沒有別的寫法,沒有選擇空間就藏不了記號。
- 14:05 Jeremy:整個生態系正往浮水印走,但不代表各家都會公開偵測器。↳ 大家都在往浮水印走,但各家不一定會把偵測工具開放給外面的人用,這是兩回事。
- 14:36 若偵測器公開,有人可反覆查詢,反推出繞過該組 key 設定的方法;所以目前還不是能保證偵測所有 AI 生成內容的鐵證方法。↳ 不開放有理由:偵測器公開後,有心人可以反覆測試、摸出規律再想辦法繞過。所以浮水印現在還不能保證抓到所有 AI 內容。
- 15:08 影像的做法不同:由一個神經網路看過未加浮水印的影像,以非常細微的方式修改它來加入訊號。↳ 影像的做法不同:圖先生成好,再由一個神經網路(一種 AI 模型)極細微地修改整張圖,把記號加進去。
- 15:39 嵌入浮水印的模型與偵測器神經網路共同訓練(cotrained);若訊號可被察覺就不合格,因為會降低影像品質。↳ 加記號的模型和查記號的模型是一起訓練的,互相配合。只要記號能被看出來就算失敗,因為那等於畫質變差。
- 16:11 中間有一個 adversarial agent 會對影像做縮小、放大、裁切、旋轉、加雜訊等轉換,偵測器仍須判斷出是否有浮水印。↳ 訓練時還有一個專門搗亂的角色,叫 adversarial agent:把圖縮放、裁切、旋轉、加雜訊。偵測器要在這些破壞後仍認得出記號。
- 17:12 實際應用:記者用 SynthID 檢查流傳的影像,例如 California 大火中奇蹟般完好的房子、Iran 戰爭的影像,偵測出是 AI 生成。↳ 這已經派上用場。記者用 SynthID 查網路瘋傳的圖,例如加州大火裡奇蹟完好的房子、伊朗戰爭畫面,查出是 AI 生成的。
- 18:13 偵測功能已內建在 Gemini app:可以問它某張影像是否為生成,它會跑 SynthID detector,回答是否由 Google 影像模型生成。↳ 一般人也能用。在 Gemini app 裡丟圖問它是不是生成的,它會跑偵測,但只能回答是不是 Google 的影像模型做的。
- 18:45 跨模型偵測的前提是注入浮水印的一方同意分享 key;SynthID portal 可查看合作機構提供的所有 key 來偵測。↳ 要查別家的內容,得對方願意交出金鑰。SynthID portal 是一個入口,集中了合作機構提供的金鑰來做偵測。
- 19:15 若某個實驗室不願分享 key,就無法偵測其內容。↳ 反過來說,哪家不肯分享金鑰,它產出的內容就查不出來。這是整套機制最大的現實限制。
- 19:15 SynthID Bio 是概念驗證(proof of concept)系統,為 AI 生成的蛋白質序列與 3D 生物分子結構加浮水印。↳ SynthID Bio 是 proof of concept(概念驗證,只證明做得到,還不是正式產品),替 AI 設計的蛋白質序列和立體結構加記號。
- 19:46 SynthID Bio structure:為由序列預測出的蛋白質結構加浮水印,建立在 AlphaFold 3 之上。↳ Structure 版處理的是蛋白質的立體形狀。它建立在 AlphaFold 3(從序列預測蛋白質形狀的 AI)之上。
- 19:46 SynthID Bio Sequence:在蛋白質序列(胺基酸字串)本身加入浮水印。↳ Sequence 版處理的是序列本身。蛋白質是一串 amino acid(胺基酸)排成的,可以想成用特定字母寫的一行字。
- 20:16 Structure 版是微調個別原子的位置(如兩原子間距離或角度略變),原子不變;Sequence 版是改變個別胺基酸的選擇。↳ 兩版差別:Structure 版原子不換,只把位置、距離或角度挪一點點;Sequence 版是在某些位置換用另一種胺基酸。
- 20:47 用途之一:偵測送到 DNA 合成公司的訂單是否來自 AI 系統。↳ 一個用途是在 DNA 合成公司把關。這種公司收到序列就幫你做出實物,浮水印能讓他們知道訂單是不是 AI 設計的。
- 21:18 主要擔憂:有人向公司訂購 DNA 帶回實驗室,做出不該做的東西或規避法規,例如已絕跡的大流行流感。↳ 最怕有人訂到 DNA 後帶回實驗室,做出不該做的東西或繞過法規。影片舉的例子是已經絕跡的大流行流感。
- 22:19 偵測到浮水印,代表可確信該序列來自內建安全護欄的系統,而非其他 AI 模型或自然界。↳ 查到浮水印反而是好消息:代表這段序列來自有內建安全把關的系統,不是來路不明的 AI,也不是自然界的東西。
- 22:19 合成公司現行做法:先驗證訂購者身分(如學術人員、大學所屬、寄送地址是實驗室)。↳ 合成公司現在的第一關是查人:訂購者是不是學術人員、是否屬於大學、寄送地址是不是實驗室。
- 22:50 再用幾種演算法把訂單內容與已知危險物資料庫比對;比中就擋下訂單,或回頭詢問動機與是否有必要許可。↳ 第二關是查貨:把訂單內容拿去跟已知危險物的資料庫比對,比中就擋下,或回頭問用途、有沒有許可。
- 23:20 AI 的風險:可做出在序列空間上與病原資料庫差很遠、卻會摺疊成有問題結構且行為相同的東西,現行系統抓不到。↳ 漏洞在這裡:AI 能設計出字面上跟危險病原差很遠、摺起來的形狀和作用卻一樣的東西,比對資料庫抓不到。
- 23:52 還可把有疑慮的片段剪貼進另一段序列以避開攔截,之後在實驗室再放回原位。↳ 另一招是把有問題的片段拆開,塞進別的序列裡躲過檢查,東西到手後再在實驗室拼回去。
- 24:22 浮水印不是要偵測所有有害物,而是標示「這是 AI 生成」並指出來自哪個系統,讓合成公司有所依據。↳ 浮水印不負責判斷有沒有害。它只標明「這是 AI 做的、來自哪個系統」,讓合成公司多一個判斷依據。
- 24:53 Protein NPNN(字幕寫法)是第三方工具、非 Google 開發,已發布多年;與 AlphaFold 相反,是從結構到序列。↳ Protein NPNN(字幕上的寫法)是別人開發、已發布多年的工具。它跟 AlphaFold 方向相反:給它形狀,它回推序列。
- 24:53 它生成序列的方式與 transformer 模型生成文字很類似,因此能套用文字浮水印方法。↳ 它產生序列的方式跟語言模型寫字很像,也是一個接一個挑,所以文字浮水印那套可以直接套上去。
- 25:53 蛋白質某些位置可互換性質相似的胺基酸(如 leucine 與 isoleucine),SynthID Bio Sequence 利用這類選擇嵌入浮水印,維持結構與功能。↳ 蛋白質有些位置換成性質相近的胺基酸也沒差(如 leucine 和 isoleucine)。記號就藏在這些選擇裡,形狀和功能不受影響。
- 26:56 團隊實際在實驗室製作了帶浮水印的蛋白質 binders 並測試,不是模擬;實驗顯示功能沒有改變。↳ 這不是只在電腦裡算。團隊真的做出帶浮水印的 protein binder(能黏上目標的蛋白質)來測,功能沒有變。
- 27:26 量測 hit rate(送去的設計有多少真的結合)與結合強度:有浮水印(兩種方案)與無浮水印的 binders 結果幾乎相同。↳ 他們看兩個數字:hit rate(送去做的設計有幾成真的黏得上)和黏得多緊。有加浮水印和沒加的結果幾乎一樣。
- 27:26 Jeremy 坦言拿到 wet lab 數據前有點懷疑,結果讓大家都很驚訝。↳ wet lab 指真的動手做的實驗。研究員承認數據出來前自己也半信半疑,結果好到大家都意外。
- 27:57 最終目標是任何實驗室都能讀取浮水印;需要模型開發者把浮水印整合進自己的系統,程式碼會開源,不必與團隊協調。↳ 最終希望任何實驗室都能讀到這個記號。這需要做模型的人自己裝進系統,程式碼會公開,不必經過 Google 團隊。
- 28:27 模型提供者與 DNA 合成公司之間需要交換 key 與浮水印細節;偵測與嵌入都還有工程改進空間。↳ 要運作起來,做模型的一方和合成公司得互相交換金鑰與設定。加記號和查記號的技術也還有改進空間。
- 28:58 只要分享 key 與 context 長度(前文多少內容影響浮水印)這兩個值,就能偵測任何採用此實作的系統的輸出。↳ 要分享的其實只有兩樣:金鑰,以及 context 長度(前面多少內容會影響記號)。有這兩個值就能查採用這套做法的系統。
- 29:28 目前階段是概念驗證加開源;Google 內部沒有蛋白質設計服務,所以正與模型開發方、合成篩檢方對話。↳ 目前只到證明可行加上公開程式碼。Google 自己不賣蛋白質設計服務,所以正在跟做模型的和做篩檢的業者談。
- 29:59 團隊自認角色是催化者,而非制定標準者,因為他們不是大家訂購蛋白質的對象。↳ 團隊把自己定位成推一把的人,不是訂規則的人,因為大家訂蛋白質的對象並不是他們。
- 30:29 合成業者的反應非常興奮,超出預期;他們知道現有過濾機制並不完美。↳ 合成業者的反應比預期熱烈,因為他們自己最清楚現在的過濾方法有漏洞。
- 32:02 約兩個月前有一份備忘錄,說明 Google DeepMind 與 Isomorphic Labs 對 bio resilience 的願景,對應英國生物安全策略的 prevent、detect、respond 支柱。↳ 約兩個月前有份文件說明 Google DeepMind 和 Isomorphic Labs 對 bio resilience(生物韌性)的想法,對應英國的預防、偵測、應變。
- 32:02 團隊著眼於用 AI 降低生物風險,同時涵蓋自然威脅與 AI 增強的威脅。↳ 他們想用 AI 降低生物風險,對象包含自然發生的疫病,也包含被 AI 強化的人為威脅。
- 32:32 變革理論:讓生物學對惡意者變得較沒用,本身就能嚇阻;強化公衛系統、讓流行病學家更易發現疫情,也能降低疫情發生機率。↳ 背後的邏輯:讓壞人覺得走生物這條路不划算,就有嚇阻作用;公衛系統更強、疫情更早被發現,也能降低出事機率。
- 33:02 Pushmeet:AI 會對人類健康與生物學理解帶來巨大正面影響(如用於藥物發現),但也會促成有問題的用途,需要各種管控。↳ AI 對健康和新藥開發的好處很大,但同樣的能力也會被拿去做壞事,所以要有多種管控配套。
- 34:07 業界已對來源標示標準有共識:把編輯或生成式 AI 的資訊放在檔案旁;但 metadata 可被剝除,所以需要浮水印提供強綁定。↳ 業界本來就有共識,用 metadata(附在檔案旁的說明資料)註明是否 AI 生成。但它能被刪掉,浮水印是綁在內容本身的。
- 35:09 Jeremy:在計算 G values 與嵌入浮水印的方式上仍有工程空間,但相信嵌入序列的隱形浮水印是辨識 AI 生成序列來源的最佳途徑之一。↳ G values 是算浮水印時用到的數值,計算和嵌入方式都還能改進。但研究員相信藏在序列裡的記號是追查來源的好方法之一。
- 35:41 貓捉老鼠的風險確實存在,所以需要 secret key;理想狀態是要移除浮水印就必須改變功能、破壞原本設計的能力。↳ 攻防追逐確實會發生,所以金鑰要保密。最理想的情況是:想把記號弄掉,就得把蛋白質的功能一起弄壞。
- 36:45 Jeremy:他們不是最早做浮水印的,但就其所知,是最早同時展示不可察覺性與功能保留,並包含 in vitro 實驗室結果的團隊。↳ 他們不是第一個做浮水印的。但就他們所知,是第一個同時證明看不出來、功能不變,還拿出 in vitro(實驗室實測)結果的團隊。
📘 術語
watermark(浮水印):隱形嵌入內容或分子中的數學訊號,不是圖庫照片上的方塊 logo
SynthID(SynthID):Google DeepMind 的浮水印系統,正被 AI 業界採用
provenance(來源/出處):能具體說出某個序列或內容是從哪裡來的
imperceptibility(不可察覺性):讓人很難看出哪部分資料被加了浮水印,否則容易被抹除
robustness(穩健性):對攻擊或轉換有抵抗力,改動訊號後浮水印仍存在
modality(模態):指文字、影像、影片、音訊等不同類型的內容
token(token(字詞單位)):大型語言模型生成的字詞,模型對可生成的 token 有一個分布
secret key(秘密金鑰):在背後指示偏好某些字的金鑰;有 key 才能偵測並分辨是哪個模型
classifier(分類器):訓練來區分模型生成與自然內容的機器學習模型,準確度會隨時間下降
adversarial agent(對抗代理):訓練時在中間對影像做縮放、裁切、旋轉、加雜訊等修改的角色
SynthID Bio structure(SynthID Bio 結構版):為預測的蛋白質結構加浮水印,建立在 AlphaFold 3 之上,微調原子位置
SynthID Bio Sequence(SynthID Bio 序列版):透過個別胺基酸的選擇,在蛋白質序列中加入浮水印
amino acid(胺基酸):蛋白質由一串胺基酸構成,就像一串文字
DNA synthesis company(DNA 合成公司):你送出想要的序列,他們替你製作出來,主持人比喻為印表機
Protein NPNN(Protein NPNN(字幕寫法)):第三方的結構到序列模型,與 AlphaFold 相反
protein binder(蛋白質結合體):會黏附(結合)的蛋白質,團隊實際製作來測試浮水印
hit rate(命中率):送進實驗室的設計當中,實際能結合的比例
wet lab(濕實驗室):指實際在實驗室做出來的實驗數據,非模擬
in vitro(體外實驗):字幕中與實驗室結果並提,指實驗室實測
metadata(中繼資料):放在檔案旁的編輯或生成資訊,但可能被剝除
bio resilience(生物韌性):用 AI 降低生物風險的方向,對應 prevent、detect、respond
proof of concept(概念驗證):目前階段只是證明這方法可行、行得通
SynthID(SynthID):Google DeepMind 的浮水印系統,正被 AI 業界採用
provenance(來源/出處):能具體說出某個序列或內容是從哪裡來的
imperceptibility(不可察覺性):讓人很難看出哪部分資料被加了浮水印,否則容易被抹除
robustness(穩健性):對攻擊或轉換有抵抗力,改動訊號後浮水印仍存在
modality(模態):指文字、影像、影片、音訊等不同類型的內容
token(token(字詞單位)):大型語言模型生成的字詞,模型對可生成的 token 有一個分布
secret key(秘密金鑰):在背後指示偏好某些字的金鑰;有 key 才能偵測並分辨是哪個模型
classifier(分類器):訓練來區分模型生成與自然內容的機器學習模型,準確度會隨時間下降
adversarial agent(對抗代理):訓練時在中間對影像做縮放、裁切、旋轉、加雜訊等修改的角色
SynthID Bio structure(SynthID Bio 結構版):為預測的蛋白質結構加浮水印,建立在 AlphaFold 3 之上,微調原子位置
SynthID Bio Sequence(SynthID Bio 序列版):透過個別胺基酸的選擇,在蛋白質序列中加入浮水印
amino acid(胺基酸):蛋白質由一串胺基酸構成,就像一串文字
DNA synthesis company(DNA 合成公司):你送出想要的序列,他們替你製作出來,主持人比喻為印表機
Protein NPNN(Protein NPNN(字幕寫法)):第三方的結構到序列模型,與 AlphaFold 相反
protein binder(蛋白質結合體):會黏附(結合)的蛋白質,團隊實際製作來測試浮水印
hit rate(命中率):送進實驗室的設計當中,實際能結合的比例
wet lab(濕實驗室):指實際在實驗室做出來的實驗數據,非模擬
in vitro(體外實驗):字幕中與實驗室結果並提,指實驗室實測
metadata(中繼資料):放在檔案旁的編輯或生成資訊,但可能被剝除
bio resilience(生物韌性):用 AI 降低生物風險的方向,對應 prevent、detect、respond
proof of concept(概念驗證):目前階段只是證明這方法可行、行得通
✏️ 小考一題
依字幕,SynthID 為「文字」加浮水印的方式是什麼?
A. 用一個神經網路在生成後細微改寫整段文字,並與偵測器共同訓練B. 在檔案旁附上記錄生成資訊的 metadataC. 在文字中插入隱藏的空白與特殊逗號D. 當下一個字有多個同樣合理的選項時,依 secret key 偏好某些字,形成可偵測的模式看答案
答案:D。[12:01]–[12:33] 說明文字浮水印利用選字的選擇空間,由 secret key 偏好某些字,偵測器看的是模式;[09:28] 明說與空白、逗號無關;[34:07] 指 metadata 會被剝除;[15:08]–[15:39] 的神經網路共同訓練是影像的做法。
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰