知識風
AI怎麼「看懂」文字和圖片的?
2026-09-12
我們常常以為AI是靠某種神秘的「理解力」在運作,但其實它學習的方式,跟我們小時候學說話、認東西的過程意外地相似。
語言模型:讀過的書多了,自然知道下一句該接什麼
大型語言模型並不是「懂」字詞的意思,而是讀過海量的文章之後,記住了哪些字詞經常一起出現、句子通常怎麼接續。就像你聽多了朋友說話的口頭禪,久而久之你也能猜到他下一句要說什麼——AI做的其實是規模放大版的這種「猜測」。
圖像辨識:看過一萬次貓,就認得出貓
圖像辨識的邏輯也很類似。AI一開始並不知道什麼是貓,但當它看過成千上萬張標記為「貓」的照片後,慢慢抓出這些照片共同的特徵:尖尖的耳朵、圓圓的眼睛、特定的毛髮紋理。這個過程很像小孩第一次認得動物繪本裡的貓,之後在路上看到真貓也能認出來——不是因為懂了「貓」的定義,而是累積了足夠多的視覺經驗。
- 語言模型=從大量文字中學會「什麼詞常接在一起」
- 圖像辨識=從大量圖片中學會「什麼特徵組合代表什麼東西」
- 兩者的共通點:靠「大量重複的經驗」找出規律,而不是真正的理解
所以下次AI精準回答你的問題,或一眼認出照片裡的東西時,不妨把它想像成一個讀了非常非常多書、看了非常非常多照片的學生——它記性驚人,但本質上,還是從「看過的東西」裡找答案。這樣想,AI好像也沒那麼難懂了。