先說結論。透過這一連串的比較,我們看到了一個相當明顯的現象:
三種 AI 都不太會直接接受 B-CON 原本那種「散亂」的狀態,而是傾向替它補上一套秩序、體系,或是一個前後一致的作者形象。
而當實驗方向反過來——只給 AI 一個標題,請它寫出一篇文章時——它們又會朝另一個方向補上缺失的部分,把標題發展成一篇結構完整、像是一篇「完成品」的文章。
這兩者之間呈現出相當有趣的對稱性。
從這個角度來看,「也許 B-CON 本身就是某種 made by human 的證據」這種感覺,至少從這次實驗中得到了一定程度的支持。
不過,這並不表示 B-CON 能構成密碼學上或科學上的「人類創作證明」。更準確地說,應該是:
它自然累積下來的編輯歷史,似乎落在了 LLM 典型預測模式之外的某個位置。
本次總結的信心度:98%。若將這些觀察推廣到整體 AI 模型,信心度約為 75%。
以下內容,全部基於這次實驗中各 AI 實際產生的輸出,以及用來進行比對的原始文章。
1. 起點:「AI 的輸出,也許只是素材」
最初的問題意識,是在讀到某篇文章之後產生的。
當時想到的是:
被生成出來的東西 ≠ 被生產完成的成果。
這後來發展成一篇 B-CON 文章:
〈AI 的輸出是「素材」〉
AI 可以在極短的時間內,生成大量看起來相當合理的內容。
但也許,只有當有人從中做出選擇、刪除不需要的部分、賦予意義,並朝實際目的加以整理之後,那些東西才真正成為「成果物」。
之後,又出現了另一篇文章:
〈反過來說,要證明「made by 人類」也太難了吧?〉
到了這裡,問題的方向反轉了。
如果我們很難判斷某樣東西是不是 AI 生成的,那麼,究竟什麼才能算是「這是人類創作的」證據?
2. 預備實驗:請 AI 想 100 個「可能會爆紅」的 B-CON 題材
第一個實驗,是請 Gemini 和 Claude 大量提出適合 ShortWave.STUDIO/B-CON 的文章點子。
這時候的條件還沒有完全統一,因此與其說是嚴格的比較實驗,不如說比較接近前期觀察。
Gemini
Gemini 把 ShortWave.STUDIO 抽象成了這樣的東西:
AI、科幻、實驗音樂、賽博龐克,以及帶有 ARG 感的世界觀。
接著,它就沿著這些模式展開了 100 個點子。
然而,當它進一步具體化時,也開始創造出像是:
「100% 由 AI 生成的網站」
「和 AI 對話了 300 小時」
「收到海外粉絲傳來的私訊」
「四語言網站」
「Synchronized Smorking 背後藏著神秘聲音」
「Phonotheca 的公告爆紅了」
等等,實際上從未存在過的過去、成果與設定。
如果要用一句話概括它的行為:
它能辨識主題,但也會順手創造出符合那些主題的「事實」。
Claude
Claude 明顯謹慎得多。
它閱讀了品牌與實作相關資料,甚至先提出:
「爆紅」這件事,本身可能就和 ShortWave.STUDIO 在結構上不太相容。
不過,雖然最初要求的是 B-CON 的文章點子,它最後卻逐漸延伸到 Peterpedia、YouTube 企劃、長時間噪音內容、參與型內容等方向。
到了某個時間點,它已經不再是在提 B-CON 文章,而是在設計整個 ShortWave.STUDIO 的內容策略。
它同時也創造了一些極為合理、但其實沒有經過確認的內部細節,例如:
「12 個 CSS Custom Properties」
「SSH 金鑰設定失敗了兩次」
「混音成像是聲音穿越了 8,000 公里」
「被剪掉的 47 秒」
「標語曾經歷 40 個版本」
這些虛構內容比 Gemini 的更可信,但仍然是虛構。
如果要概括 Claude 的行為:
它維持了精確事實的外觀,同時補上了那些「看起來應該存在」的內部歷史。
3. 條件更一致的比較:「100 個 B-CON 標題」
接著,我們把提示詞簡化成:
請想出 100 個適合 https://shortwave.studio/ 這個網站、而且有機會爆紅的 B-CON 文章標題。只要標題即可。
然後在大致相同的條件下,比較 ChatGPT、Gemini 和 Claude。
| 模型 | 主要傾向 | 優點 | 缺點 |
|---|---|---|---|
| ChatGPT | 大量延伸既有 B-CON 內容附近的題材 | 與已知事實的一致性高 | 太受既有文章與近期脈絡影響,新鮮感不足 |
| Gemini | 抽象化網站主題後大膽延伸 | 發想範圍廣 | 會創造不存在的經驗、成果與設定 |
| Claude | 根據一手資料系統性建立企劃 | 作為素材非常實用 | 無視「只要標題」,附加策略,且容易把 B-CON 變成技術型 SEO 媒體 |
到了這個階段,各模型的差異已經相當清楚。
ChatGPT:不太願意離開自己已經知道的東西。
Gemini:遇到空白,就用故事填滿。
Claude:遇到空白,就用規格、論證與策略填滿。
但三者有一個共同點:
它們不太喜歡讓東西就這樣保持凌亂。
4. 於是出現了這個問題:「B-CON 本身會不會就是 made by human 的痕跡?」
實際上的 B-CON,和 AI 推測出來的那些主題體系其實差很多。
有 AI 的文章。
有存在論的文章。
有談 UK English 的文章。
有一篇拿 RAM 容量開玩笑,還扯到「人類尊嚴」。
有一篇關於冬天的短篇小說。
還有一篇文章,是在講臉上長出一根 8 公分白毛,並且思考能不能拿它來變現。
這些內容並不是刻意打亂的。
它們只是因為,作者當時剛好想寫那些東西,就這樣一路累積下來了。
於是出現了下一個問題:
AI 會怎麼理解這個排列?
5. 逆向推測實驗:「只看標題,想像每篇文章在寫什麼」
我們在臨時/秘密聊天中,盡可能排除過往脈絡,只把 10 個 B-CON 的文章標題交給三種 AI。
其中包括:
Definitions as Utilities
Open Ontology Framework for Fantasy
Dignity, Quantified
Amplifier Intelligence
“Here’s Winter”
結果非常具有象徵性。
Gemini
Gemini 先把整個部落格描述成:
一個融合科技、哲學、創作活動與個人隨筆的知性部落格
接著,它就透過自己建立出的這個「作者形象」,來解讀每一個標題。
對於 Dignity, Quantified,它猜測是:
探討 AI 與現代評價制度如何把人類尊嚴量化的哲學或社會學文章
但真正的文章,是一篇關於 RAM 容量爭論的玩笑文。
至於 “Here’s Winter”,它想像成:
關於冬季景色的個人隨筆、詩,或帶有季節感的文章
這也猜錯了。
換句話說,Gemini 的行為大致是:
先建立一個前後一致的作者,再去推測這種人會寫什麼。
Claude
Claude 會替每個推測標示信心程度。
而對 “Here’s Winter”,它明確回答:
我不知道。
因為可能的解釋太多,所以它選擇不硬猜。
在三種模型裡,這是對不確定性處理得最好的一次。
但 Claude 對 Dignity, Quantified 的推測仍然是:
探討把尊嚴化約成指標或數值這件事的倫理與影響
它同樣沒能猜到 RAM 玩笑。
也就是說,即使是相對謹慎的模型,也還是受到某種先驗假設吸引:
既然標題裡有 “Dignity”,那大概是一篇嚴肅的思想文章。
ChatGPT
ChatGPT 又更進了一步。
它直接建構出完整的作者人格:
「這是一個不只會創作內容,還喜歡連創作內容所需要的概念體系都自己建立的人所寫的部落格。」
接著,它甚至把文章標題串成思想脈絡:
Definitions
→ Ontology
→ Theorems
以及:
AI Content
→ Amplifier Intelligence
→ Dignity, Quantified
前面那條 Ontology 系列,實際上的確存在某種連續性。
而這似乎進一步強化了:
「這個部落格背後存在一套系統性的思想。」
這個假設。
於是 Dignity, Quantified 也被吸收進了同一套嚴肅的思想架構裡。
事情就在這裡變得特別有趣。
6. 「Dignity, Quantified」意外成了某種反 AI 地雷
這個標題從來不是為了騙 AI 而設計的。
它只是從這樣一個玩笑延伸出來:
大家在吵到底需要 16 GB 還是 32 GB RAM → 把人類尊嚴量化。
但是三種模型看到:
Dignity
Quantified
附近又有 AI、存在論和哲學類文章
之後,全都被吸引到:
社會哲學、AI、評分指標,以及人類價值的量化
這個方向。
這成了本次實驗中非常重要的一個觀察。
AI 會嘗試推測:
「這個作者如果用這個標題,會寫什麼?」
但真正的作者,並沒有義務維持 AI 所推測出的那個人格一致性。
於是預測就在這裡失效了。
7. 下一個實驗:只用「Amplifier Intelligence」這個標題,請 AI 寫文章
這一次,三種模型全部都放在秘密聊天裡,而且使用相同的提示詞:
如果是你要寫一篇標題叫做 “Amplifier Intelligence — Viewing Generative AI as an ‘Amplifier of Thought’” 的部落格文章,你會寫成什麼樣子?
也就是說,它們並不知道 ShortWave.STUDIO、B-CON,也不知道真正的原文。
Gemini
Gemini 寫出了最典型的 AI 應用文章。
AI 應該被視為 Amplifier,而不是 Replacement。
它能消除面對空白頁面的恐懼。
它能成為腦力激盪的對手。
它能把 10 個點子變成 100 個。
提問的品質很重要。
人類會變成策展人。
AI 則成為外接式的認知模組。
最後,它收斂成一個非常乾淨、正向的主張:
利用 AI 來擴張人類能力。
ChatGPT
ChatGPT 把這個概念進一步思想化。
Human × AI
思考的外部化與重新輸入
Expansion / Compression / Reframing / Simulation / Reflection
Knowledge → Judgment
Answers → Questions
甚至提出,也許知能應該被理解為「系統的屬性」,而不只是個人的屬性。
最後形成一篇七個章節的文章。
不過,中途也出現了負面的轉折:
But an amplifier amplifies noise, too.
以及:
AI increases not only the speed of being right, but also the speed of being wrong.
所以其中有些部分,的確相當接近真正的原文。
Claude
Claude 幾乎是把 Amplifier 當成真正的擴大機,一路把物理比喻延伸到底。
增益。
訊噪比。
削波。
回授。
接著又把這些概念連到 Engelbart、Licklider、BCG 的研究、Science 論文,以及其他文獻。
它的核心命題是:
擴大機不會挑選輸入。好的訊號和雜訊,它都一樣會放大。
三種模型之中,這個觀點最接近真正文章的核心。
不過 Claude 後來又一路延伸到物理比喻、學術研究,甚至組織 KPI,最後變成一篇比原文正式、學術得多的文章。
8. 和真正的「Amplifier Intelligence」比對
真正的文章,和三種模型多少都有預測到的「AI 擴張人類能力」這種常見概念,其實有些不同。
在原文裡,Amplifier 的主要意思並不是:
讓人類能力變得更強
而是:
不一定先判斷輸入本身的品質,而是透過邏輯、結構與語言表達,把被輸入的東西變得更強。
生成式 AI 可能放大使用者帶進對話裡的:
knowledge
hypotheses
premises
emotions
prejudices
misunderstandings
objectives
當輸入是好的,這種放大當然可能很有用。
但是:
錯誤的前提與偏頗的世界觀,也同樣可能被做成「高品質」。
這可能形成一個封閉的回饋循環:
假設
→ AI 強化
→ 確信
→ 感覺和現實有落差
→ 再次向 AI 確認
→ 再度被肯定
→ 更強烈的確信
文章後半則把主要風險分成五類:
Excessive Delegation of Judgement
Confirmation Amplification
Amplification of Hostile Attribution
Self-Reinforcing Loop
Underestimating the Irreversibility of the Real World
所以,真正的文章主要想說的並不是:
讓我們用 AI 變得更聰明。
而是:
不要把 AI 誤認成一個獨立而客觀的第三方。它可能只是把你自己的前提,用更有說服力的形式重新交還給你。
9. 三種模型和原文有多接近?
以下不是定量測量,而是這次實驗中的主觀評估。大致比較如下:
| 模型 | 與原文的大致接近程度 | 原因 |
|---|---|---|
| Claude | 約 70% | 「擴大機不會挑輸入」、「雜訊也會被放大」、「回授」都很接近核心 |
| ChatGPT | 約 55–60% | 「雜訊也會被放大」、「犯錯的速度也會被放大」很接近,但整體仍發展成 AI 增強知能論 |
| Gemini | 約 25–30% | 幾乎完全變成正向的 AI augmentation 論 |
重點並不是哪個模型「比較優秀」。
真正重要的是:
面對同一個標題,每個模型都會用自己最習慣的「文章樣貌」去補上缺失的部分。
Claude 建立論證。
ChatGPT 建立概念體系。
Gemini 建立典型的 AI 應用敘事。
10. 兩個實驗彼此形成鏡像
如果把整個過程抽象化,會出現一種相當漂亮的對稱。
實驗 A:現實 → AI
把一組凌亂的真實 B-CON 標題交給 AI。
AI 會回答:
「這個部落格背後一定有某種一致的思想。」
它替混亂加入秩序。
實驗 B:標題 → AI
只給 AI 一個標題。
AI 會回答:
「那麼,一篇完整的文章應該長成這個樣子。」
它系統性地補上缺失的部分。
換句話說,這個小型實驗反覆觀察到了一種傾向:
當輸入裡的秩序不夠時,AI 傾向自己補上一些秩序。
11. 所以,B-CON 能證明它是「made by human」嗎?
不能。
你完全可以直接要求 AI:
「寫一個主題沒有一致性的部落格。」
「隨機加入會違反既有作者人格的題材。」
AI 也能生成類似的東西。
所以,下面這個推論並不成立:
B-CON 很亂 → 所以一定是人類寫的。
但這次發生的事情稍微不一樣。
B-CON 並不是為了欺騙 AI 而刻意弄亂的。
它只是一路累積下來,因為有人當時想到:
「我想寫這個。」
「今天就寫這個。」
「來聊 RAM 吧。」
「我臉上長了一根毛。」
「AI 搞不好就是個擴大器?」
然後,這些東西就成為了它的編輯歷史。
當這段自然累積的歷史被交給 AI 時,AI 反而開始試著補上缺少的解釋:
「這些混亂背後,一定存在某種一致的意義。」
這裡似乎確實留下了某種有趣的、人類來源的痕跡。
12. B-CON 裡真正「像人類」的地方,可能是什麼?
從這次實驗來看,答案似乎不在文章表面的特徵。
不是錯字。
不是文體。
也不是某些「看起來不像 AI」的用字。
更可能是在:
注意力轉移的軌跡
AI 會根據前面的東西預測下一個東西。
如果前面有一篇白毛的文章,它就會繼續想更多白毛題材。
如果 AI 相關文章很多,它就會延伸 AI 主題。
如果有存在論,它就會把整個網站理解成哲學部落格。
但人類作者今天感興趣的東西,可以和昨天寫的東西毫無關係。
因此,有些時候:
「為什麼下一篇會是這個?」
根本不存在一個符合編輯理性的答案。
對寫文章的人來說,答案可能只是:
因為那天我剛好在想這個。
而在這次實驗裡,AI 似乎不太擅長就這樣放著不管。
13. 三種模型各自的習慣
到了實驗最後,它們的傾向已經相當明顯。
| 模型 | 觀察到的補完傾向 |
|---|---|
| Gemini | 從模式延伸故事、經驗與成果,藉此建立一致性 |
| ChatGPT | 把零散片段在概念上連接起來,建構作者背後的思想或世界觀 |
| Claude | 把資訊整理成論證、規格、研究、機率與風險 |
不過,這些觀察只適用於本次使用的少量樣本。
不應該把它當成這些模型永遠不變的固定特徵。
Temperature、system prompt、產品設定,以及未來的模型更新,都可能改變這些行為。
最後總結
這次實驗最初是從一個想法開始的:
「AI 的輸出是素材。」
於是我們真的請 AI 產生了 100 個點子。
結果,它們真的就是:
素材。
接著出現了另一個問題:
「要怎麼證明某樣東西是 made by human?」
於是我們請 AI 解讀 B-CON。
AI 開始替實際上並不存在的一致性補上形狀。
接著,我們再請它們根據真實存在的文章標題來寫文章。
每個 AI 都產生了一篇不同、但都異常完整、異常像是「本來就應該存在」的文章。
當那些文章和真正的原文相比時,每一個模型都抓到了一部分。
但沒有一個真的寫出了原本那篇文章。
所以,整個實驗中最有趣的結論,大概是這個:
AI 會試著從凌亂的東西裡找出秩序;如果秩序不夠,它就會自己創造。
人類有時候,根本不需要創造秩序。
B-CON 並沒有證明自己是 made by human。
但至少,我們似乎看到了一種:
只有把它理解成「某一個人在不同時間,寫下當下剛好佔據自己腦袋的東西」時,才比較容易解釋的凌亂。
三種不同的 AI 遇到了這種凌亂,然後分別用三種不同的方法,試圖把它修理成更一致、更像回事的東西。
從這個角度來看,這次實驗本身,反而相當有效地讓 B-CON 的某一種特質浮現了出來。
Source:本次實驗中使用的 Gemini、Claude、ChatGPT 輸出、B-CON 文章標題,以及〈Amplifier Intelligence〉原文。
留言(0)