第二版補上研究脈絡、分析步驟、推論限制與目前的實作結果。本文由 OpenAI GPT-5.6 協助查核與起草;研究數字依 StoryScope v6 與原始 repository 核對,工作坊流程由我設計。尚未完成的參與者研究,會明確標示為待驗證問題。
很多人談「AI 味」時,注意力停在破折號、華麗形容詞、排比和過度完整的語氣。這些表面特徵很容易看見,也很容易修改。問題在於,句子改得自然以後,故事可能仍維持同一種構造:主題由敘事者說明,情節沿著單一因果線前進,角色在結尾得到內在成長,情緒集中寫成胸口發緊、手心冒汗,讀者幾乎沒有需要自行補足的空白。
這正是 StoryScope 想處理的問題。研究團隊刻意排除多數表面語言特徵,改看角色能動性、因果鏈、時間結構、資訊揭露、情緒表現與互文關係。研究結果顯示,在他們建立的英文長篇故事資料裡,敘事結構本身已經帶有很強的來源訊號。
這個結果值得文學課使用,使用方式必須克制。它提供一套近讀語彙,也提供一個可重做的分析流程;它無法直接裁決某篇中文極短篇由誰寫成,更沒有證明依照這些特徵修改就會得到較好的小說。
這篇文章使用三層材料
原來的版本讀起來困難,主因是三種性質不同的材料混在一起。第二版將它們分開。
| 層次 | 材料 | 可以支持的說法 | 支持不了的說法 |
|---|---|---|---|
| 論文實證 | StoryScope v6 與公開程式碼 | 特定英文長篇資料中,哪些敘事特徵和來源高度相關 | 中文短篇判源、文學價值、個別作者是否使用 AI |
| 工具轉譯 | Sepia repository | 如何將研究特徵整理成寫作診斷與修訂步驟 | 修訂後必然更像人、必然更好讀 |
| 工作坊設計 | writing.mashbean.net 的實作 | 如何保存提示、模型版本、作品與匿名評論 | 尚未蒐集資料前的教學成效與因果效果 |
以下每一節都標明自己處在哪一層。論文數字不會直接替工具背書,工具規則也不會被當成工作坊成效。
StoryScope 怎麼做分析
StoryScope 的資料從 Books3 裡的 10,272 篇人類短篇故事開始。研究團隊請 Gemini 2.5 Flash 依每篇人類作品反推出一個寫作題目,再交給 Claude Sonnet 4.6、DeepSeek V3.2、Gemini 3 Flash、GPT-5.4 與 Kimi K2.5 各寫一篇鏡像故事。每個題目因此有一篇人類作品和五篇模型作品,總數為 61,608 篇,平均約 4,753 個英文字。
分析流程有五個步驟。
- GPT-5.1 將每篇故事轉成十個敘事面向的結構化模板,包含角色、社會關係、事件、情節、結構、場景、時間、揭露、視角與風格。
- 研究團隊抽出 100 組題目,共 600 篇故事。GPT-5.1 在隱去來源名稱的條件下比較同題六篇作品,尋找反覆出現的差異。
- 模型提出 408 個候選特徵,研究團隊以向量分群去除重複,留下 304 個可選項化的問題。
- Gemini 3 Flash 對六萬多篇故事逐項標記。研究報告提供兩種可靠度檢查:五次重跑的 Krippendorff’s alpha 為 0.90;240 個「故事 × 特徵」項目的人機 Cohen’s kappa 平均為 0.84。
- 研究團隊把特徵編碼後交給 XGBoost,並以題目為單位切分訓練集與測試集,避免同一題的不同來源版本分散到兩邊。SHAP 與 50 次 bootstrap 用來挑出穩定的核心特徵。
完整流程與執行指令可在 StoryScope repository 核對。這裡有一個容易忽略的重點:敘事特徵也由語言模型抽取。它比黑箱判源器容易解釋,仍然是一套模型中介的測量系統。
93.2% 的條件
研究使用 8,739 組題目、52,434 篇故事訓練分類器,最後在完全留出的 1,377 組題目、8,262 篇故事上測試。只使用 257 個敘事特徵時,人類/AI 二元分類的 macro-F1 為 93.2%;加入風格特徵後為 96.0%。只留 30 個核心敘事特徵時為 84.8%。改成六種來源歸因,敘事特徵的 macro-F1 降為 68.4%。
這些分數描述封閉資料集上的分類表現。每一篇測試故事都來自研究者已知的六種來源,模型版本與生成條件也在研究範圍內。93.2% 沒有提供「某篇投稿有 93.2% 機率使用 AI」這種個案機率。
研究另做了兩項值得注意的壓力測試。長度配對後,敘事分類仍維持 93.2%,表示結果無法只用篇幅差異解釋。278 篇 Gemini 故事經 LAMP 清除陳腔、冗贅說明與華麗文風後,原本 95.5% 的分類表現降到 93.9%。表面潤飾沒有明顯改變敘事構造。
語氣下面的四組結構
以下數字都是資料集中的群體比例。它們適合形成閱讀問題,沒有資格成為個案證據。
一、作品把意思說到多滿
模型作品由敘事者直接評論主題的比例為 77%,人類作品為 52%;模型作品把對話用於哲學辯論的比例為 59%,人類作品為 34%。這組差異指向「意義被過度決定」:角色和事件已經表達過一次,敘事者又替讀者總結一次。
近讀時可以問:刪除最後一段說明,前文能否自行成立?如果不能,問題可能在前面的材料不足,未必是結尾語氣。
二、因果線收得多緊
模型作品由主角選擇推動結局的比例為 69%,人類作品為 46%;沒有支線的比例為 79% 對 57%;以內在理解或接受收束的比例為 47% 對 27%。模型故事在這批資料裡更偏向單一路徑、明確成長與可解釋的結尾。
近讀時可以問:某一個偶然、旁支人物或未解關係能否留在作品裡?加入鬆動不保證更好,卻能測試故事是否只有一條預設軌道。
三、情緒交給哪一種訊號
模型作品以身體感覺表達情緒的比例為 81%,人類作品為 38%;使用嗅覺意象的比例為 82% 對 57%。相對地,人類作品直接命名情緒的比例為 29%,模型作品只有 8%。常見的「胸口發緊」因此可能屬於更深層的情緒策略,而非單一陳腔。
近讀時可以問:一段情緒同時用了身體、動作、對話、明確命名或沉默中的哪幾種?選擇要服務人物和情境,不需要把身體感覺全部刪除。
四、作品和外部世界怎麼接觸
人類作品具名引用文本或作者的比例為 47%,模型作品為 24%;直接對讀者說話的比例為 28% 對 7%。人類作品也有較高的時間跳接、延後揭露與重新脈絡化程度。
近讀時可以問:作品裡有哪些具體物件、地方、文本或歷史關係只能出現在這個世界?這個問題比加入更多「真實感細節」精確,因為它要求細節參與敘事關係。
推論容易在哪裡失足
資料來自英文長篇故事
平均四千多個英文字可以支撐支線、人物網絡與多次時間變化。中文三百字極短篇承載不了同樣的特徵密度。模型語言、文化脈絡與文類都改變時,原比例也可能改變。
題目由人類作品反推
每組鏡像故事的題目來自一篇既有人類作品。這個設計讓同題比較成立,也讓資料和自然發生的 AI 創作情境有所距離。真實作者可能反覆提示、混合改寫、加入私人材料,這些行為沒有被完整模擬。
分析與標記依賴其他模型
GPT-5.1 負責模板、比較與特徵發現,Gemini 3 Flash 負責大規模標記。人類驗證結果不差,驗證樣本只有 240 個故事特徵項目。某些文學概念在模型模板中如何被壓縮,仍可能影響後續分類。
研究測量來源差異,沒有測量文學品質
高分類分數只表示兩群故事在這套特徵空間裡分得開。讀者喜歡哪一篇、哪一篇具有文學價值、修改後是否更有效,都需要另外設計讀者研究。
模型版本會移動
研究使用 2025 至 2026 年的特定模型版本。生成模型、平台提示與使用者寫法持續變化。特徵可以當作目前的觀察座標,不能假設它們永久穩定。
Books3 帶有資料倫理問題
人類故事來自 Books3。研究團隊沒有公開原文,仍無法消除語料取得與作者同意的爭議。這一點會限制研究成果如何被移用到教育、商業判源與著作權判斷。
Sepia 做了哪一步轉譯
Sepia 把 StoryScope 與其他研究整理成三層修訂程序:敘事架構、篇章流動、表面語言。它還提供三十項診斷與不同模型的特徵清單。對創作者而言,這比單純刪除「AI 常用詞」更有操作性。
這裡發生了一次重要轉譯。StoryScope 測量哪些特徵和來源相關;Sepia 將部分差異寫成修改建議。從相關性走到處方,中間需要成效研究。Sepia 自己也提醒,每篇作品只挑三到五個動作,目標放在人類分布的中間區域。三十項規則全部套用,會製造另一套穩定格式。
我目前不會把 Sepia 直接裝成工作坊的自動改稿器。它更適合作為教師備課與作品會談的問題庫。創作者看到診斷、選擇是否採用,系統保存採用內容,讀者的回應才能和修改動作相互對照。
工作坊怎麼使用這些材料
九月課堂的現場練習把研究縮成四種可見的結構提醒:主題明說、揭露時機、情緒策略、因果鬆動。參與者可以不選,最多選兩項。系統保存共同題目、創作者補充、被選取的提醒、完整 developer 與 user prompt、模型版本和原始輸出。
匿名讀者會收到另一篇作品,選一個閱讀角度並留下一句具體評論。即時儀表板只呈現動物代號、進度、作品與評論。現場流程的用途是讓一次模型介入有完整紀錄,也讓作者看見讀者實際回應了哪個地方。
帶回家的正式研究保留較長作品、最多五次成功生成、匿名評讀、提示揭露後重評與評論來源判斷。正式樣本、測試 cohort、評讀介面測試使用不同標記,避免介面測試資料進入正式分析。
目前已經有什麼成效
目前能確認的是系統成效。網站已能保存提示全文、模型版本、生成結果、匿名分配、評讀草稿、送出評論與階段切換。三則最新的評讀介面測試評論也仍在遠端資料庫裡,沒有因新版部署消失。
教學與創作成效仍在等待資料。現階段無法宣稱四個提醒改善了作品,也無法宣稱匿名評論比具名評論更有效。九月工作坊至少要回答以下問題:
- 參與者實際選了哪些結構提醒,哪些完全沒選?
- 讀者的評論能否指出具體句段與敘事效果?
- 提示揭露前後,評分改變了多少,改變理由是什麼?
- 被選取的提醒和讀者感受到的差異能否對上?
- 模型介入增加了作者的控制感,還是只增加文字的平滑度?
這些問題都有相對應的紀錄欄位。樣本數偏小時,結果只能作為課堂探索與後續研究設計,不能包裝成普遍結論。
我從這篇研究帶走的東西
StoryScope 讓「AI 味」從模糊直覺變成一組可以討論的敘事問題。它的價值集中在測量方法與觀察語彙。Sepia 提供可操作的修訂框架,也增加了處方化的風險。工作坊的任務,是將每次介入留下來,讓作者的選擇、模型輸出與讀者反應能被逐一核對。
一篇小說是否成立,仍要回到作品、讀者與具體情境。研究工具可以讓討論更精確,也應留下足夠空間,容納文學中那些無法被三十個特徵預先規定的部分。
參考資料
- Russell, Jenna, Rishanth Rajendhran, Chau Minh Pham, Mohit Iyyer, and John Wieting (2026). “StoryScope: Investigating idiosyncrasies in AI fiction.” arXiv:2604.03136v6.
- StoryScope repository.
- Sepia repository.