當你跟 AI 對話時,發生了什麼事?


🏦 台灣Pay 銀行轉帳 💙 PayPal
解釋 AI 模型如何靠「預測」產生回覆,以及因此該有的四個使用習慣
- 00:00 講者 Jane 在 Anthropic(Claude 的開發公司)負責使用者體驗,要說明 AI「思考」時實際在做什麼
- 02:32 要把下一個字預測好,不能只看最後幾個字,必須弄清楚句子往哪走、段落在論證什麼、好的答案應該是什麼
- 04:34 不同模型可能以不同方式補完模式,值得多實驗找出適合你的;Anthropic 會在官方 blog 持續分享這方面的研究
💡 你可以怎麼用:下次提問前,先用一兩句話交代你是誰、要做什麼、想要什麼樣的結果,並請它給兩三個版本讓你挑。碰到價格、新聞或要拿去用的數字,就明講「請上網查並附來源」,再點開來源自己核對。
看全部 27 條重點
🧑🏫 這支影片由 Anthropic 的 Jane 講解:你按下送出之後,AI 到底怎麼寫出回覆。重點是 AI 不是在查資料,而是在「預測」接下來該寫什麼。懂了這一點,就知道它為什麼有時很厲害、有時卻講得很篤定但其實是錯的,也知道該怎麼用才安全。
- 00:00 講者 Jane 在 Anthropic(Claude 的開發公司)負責使用者體驗,要說明 AI「思考」時實際在做什麼↳ Jane 在 Anthropic 負責使用者體驗,也就是讓產品好用、好懂的工作。這支影片要拆解你送出訊息後,AI 背後實際在做什麼。
- 00:00 開場提出常見誤解:AI 是在讀整個網路?從資料庫複製答案?只是更高級的搜尋引擎?↳ 很多人以為 AI 會即時翻遍整個網路、從資料庫抄答案,或只是比較聰明的 Google。影片一開始就要推翻這些想像。
- 00:00 像 Claude 這樣的 AI 模型是靠「預測」運作:讀你的訊息,運用訓練時學到的一切,一點一點寫出回覆↳ 核心是 prediction(預測):模型讀完你的訊息,用訓練時學到的東西推算接下來最適合寫什麼,一點一點寫出回覆,而不是去哪裡找現成答案。
- 00:31 回覆會逐字出現,每個字都是根據前面所有內容選出來的↳ 你看到文字一個一個冒出來,不是特效。它真的是一個字接一個字產生,每個新字都參考了前面已經寫出來的所有內容。
- 00:31 令多數人意外的是:模型一次寫一個字,但它並不是一次只想一個字↳ 它一次只輸出一個字,但選字時考慮的是全局。就像人說話也是一個字一個字講,腦中卻早就知道整句想表達什麼。
- 00:31 手機鍵盤在你打「how have you」後建議「been」也是預測,因為鍵盤學過哪些字常接在哪些字後面↳ 手機打「how have you」後跳出「been」,就是最陽春的預測:鍵盤看過很多句子,知道這幾個字後面最常接什麼。
- 01:01 但簡單的預測鍵盤只看最後兩三個字,不知道你想說什麼、句子要往哪走;AI 模型遠遠不只如此↳ 差別在於,鍵盤只看最後兩三個字,完全不懂你想講什麼。AI 模型會讀懂整段脈絡,兩者的層次差很多。
- 01:01 AI 模型用大量文字和其他資訊訓練,這些叫做 training data(訓練資料)↳ training data(訓練資料)是拿來教模型的大量文字和其他資訊,就像學生的課本加題庫。模型的能力都是從這裡學來的。
- 01:01 在你和它對話之前,模型已經重複了數十億輪練習:看一段文字、猜下一個字、看猜得多接近、微調,再來一次↳ 第一階段的練習很單純:遮住下一個字讓它猜,對答案、微調,再猜。重複數十億次之後,它就掌握了語言和知識的規律。
- 01:31 第二階段叫 fine-tuning:模型的完整回答會被評分,有時由人評,有時依據一套書面準則評↳ fine-tuning(微調)是第二階段:不再只猜單一個字,而是看它整篇回答寫得好不好。評分可能由人來打,也可能依照一份寫好的準則。
- 01:31 fine-tuning 會把模型推向更有用、較不會誤導或造成傷害的回答;兩個階段都影響模型的生成能力↳ 評分是為了把它往「更有幫助、比較不會誤導或傷人」的方向調整。所以它回答的樣子,是兩個階段一起塑造出來的。
- 02:02 上述訓練都只到某個日期,叫 training cutoff;之後的事實或資訊,模型若不靠網路搜尋等工具就無法可靠得知↳ training cutoff(訓練截止日)是訓練資料的最後日期。這天之後發生的事它沒學過,除非透過網路搜尋等工具去查,不然它講的不一定可靠。
- 02:02 即使工具有搜尋功能,也不能假設模型已經上網搜尋過才回答;想確定就直接要求它搜尋↳ 工具有搜尋功能,不代表這次回答它真的去查了。重要的事情就直接講「請上網搜尋」,不要默認它已經查過。
- 02:02 模型搜尋網路時通常會附上來源,你可以檢查來源來確認輸出是否正確↳ 它上網查資料時,通常會附上來源連結。點進去看原文是不是真的這樣寫,是確認答案對不對最直接的方法。
- 02:32 要把下一個字預測好,不能只看最後幾個字,必須弄清楚句子往哪走、段落在論證什麼、好的答案應該是什麼↳ 回到預測:想把下一個字猜準,光看前幾個字不夠。它得先搞懂這句要說什麼、這段在論證什麼、怎樣的回答才算好。
- 02:32 模型在輸出下一個字(甚至音節)前,會考慮前面所有內容:上傳的文件、memory、system prompt、你的提示、對話紀錄↳ 寫下一個字之前,它會一起考慮你上傳的文件、memory(工具記得的你過去的資訊)、system prompt(工具預先給它的指示)、你的提問和先前的對話。
- 02:32 這整個過程會對下一個字重複進行,直到回覆完成↳ 每寫出一個字,它就帶著上面這些內容再算一次下一個字,一路重複到整個回覆寫完為止。
- 03:03 理解 AI 是預測系統,你就能更好地使用它並解讀它的輸出↳ 知道它是在「預測」而不是在「查詢」,就比較能理解它擅長什麼、可能在哪裡出錯,也知道該怎麼看待它給的答案。
- 03:03 它能寫出從未存在過的內容,是因為它在「生成」,而不是從某處調出答案↳ 它能寫出世上從來沒有過的詩、信或企劃,是因為它每次都在現場「生成」新內容,不是從某個倉庫把答案拿出來。
- 03:03 它有時會很有自信地說出錯誤內容,原因相同:它產生的是「好答案看起來的樣子」,通常與事實相符,但偶爾不符↳ 同樣的道理,它寫出來的是「好答案看起來該有的樣子」。大多數時候跟事實一致,但偶爾不一致,而且錯的時候語氣一樣篤定。
- 03:33 因為偶爾會與事實不符,所以你的判斷仍然重要↳ 正因為它沒辦法保證每次都對,最後把關的還是你:這個答案合不合理、要不要採用,都要自己判斷。
- 03:33 習慣一:給它脈絡。告訴它你是誰、在做什麼、好的結果長什麼樣子,這些都會成為模式的一部分↳ 習慣一:交代背景。例如說「我是國小老師,要寫一封給家長的通知,希望簡短有禮貌」。這些資訊會直接影響它寫出什麼。
- 03:33 習慣二:記得 cutoff。價格、新聞等近期資訊可能過時,除非工具告訴你它搜尋過網路↳ 習慣二:記得它有截止日。問價格、新聞、最新規定這類會變動的事時,除非它表明有上網查過,否則答案可能已經過時。
- 03:33 習慣三:要求多個選項。因為它是生成而非檢索,沒有單一儲存的答案,可以要幾個版本或換個語氣重試↳ 習慣三:多要幾個版本。它每次都是重新生成,沒有唯一的標準答案。可以請它一次給三個選項,或換個語氣重寫,再挑你喜歡的。
- 04:03 習慣四(最重要):再次確認輸出。自信的語氣或精美的結果不代表正確;依問題的重要程度,錯誤會造成問題時就查證事實↳ 習慣四最重要:查證。講得很有把握、排版很漂亮,都不等於正確。事情越重要、出錯的代價越高,越要自己核對事實。
- 04:03 總結:每次傳訊息都是交給它一個模式的開頭,它依訓練所學把模式補完↳ 總結:你每傳一則訊息,就等於給它一段開頭,它再依照訓練學到的規律把後面接完。所以你給的開頭,會決定它往哪個方向寫。
- 04:34 不同模型可能以不同方式補完模式,值得多實驗找出適合你的;Anthropic 會在官方 blog 持續分享這方面的研究↳ 不同模型接續的方式不太一樣,值得多試幾個,找出最順手的。Anthropic 也會在官方 blog(部落格)持續分享這方面的研究。
📘 術語
prediction(預測):模型讀取訊息後,根據前面所有內容逐字選出下一個字來寫出回覆
training data(訓練資料):模型訓練時使用的大量文字和其他種類的資訊
fine-tuning(微調):第二階段,由人或書面準則為完整回答評分,推動模型給出更有用、較少誤導或傷害的回答
training cutoff(訓練截止日):訓練資料截止的日期,之後的資訊模型若不靠搜尋等工具就無法可靠得知
system prompt(系統提示):字幕列為模型輸出前會考慮的內容之一,未進一步解釋
memory(記憶):字幕列為模型輸出前會考慮的內容之一,未進一步解釋
training data(訓練資料):模型訓練時使用的大量文字和其他種類的資訊
fine-tuning(微調):第二階段,由人或書面準則為完整回答評分,推動模型給出更有用、較少誤導或傷害的回答
training cutoff(訓練截止日):訓練資料截止的日期,之後的資訊模型若不靠搜尋等工具就無法可靠得知
system prompt(系統提示):字幕列為模型輸出前會考慮的內容之一,未進一步解釋
memory(記憶):字幕列為模型輸出前會考慮的內容之一,未進一步解釋
✏️ 小考一題
根據影片,AI 模型有時會很有自信地說出錯誤內容,原因是什麼?
A. 它產生的是「好答案看起來的樣子」,通常與事實相符但偶爾不符B. 它在網路上搜尋到了錯誤的來源C. 它從資料庫複製了過時的答案D. 它只看最後兩三個字來預測看答案
答案:A。[03:03] 字幕說明:It's producing what a good answer would look like, and usually that lines up with reality. [03:33] Occasionally it doesn't.
💛 覺得有幫助?支持一下


課本免費、沒有廣告,支持與否都能照常讀 🐰