從回答問題到完成工作:AI 模型演進大事記
title: 從回答問題到完成工作:AI 模型演進大事記 subtitle: 掌握 2024–2026 主流 AI 模型的核心改版與趨勢 seal: 教材 eyebrow: Courseware · 技術趨勢 lead: AI 已從文字對話,走向能推理、操作工具、完成多步驟工作的夥伴。 notes: 開場時,可以先問學員:「大家現在最常用哪個 AI 工具?都用它來做什麼?」從學員的日常經驗切入,引導到 AI 能力的演進。 為什麼這件事很重要? {#為什麼這件事很重要}
AI 的角色正在發生根本性的轉變。
::: pair [過去] 問答助理 我們問一個問題,它給一個答案。互動是單次的、片段的。 [現在與未來] 工作夥伴 我們給一個目標,它規劃步驟、使用工具、持續完成工作。 :::
<!-- notes: 這頁的目的是建立共識:為什麼我們需要關心模型改版?因為 AI 的能力邊界一直在擴大,從單純的聊天機器人,變成可以實際分擔工作的數位同事。請學員思考一下,他們的工作流程中,有哪些環節是希望 AI「夥伴」能幫忙完成的。 --> 這 15 分鐘,我們將會學到 {#這-15-分鐘-我們將會學到} 釐清術語:產品、模型、工具怎麼分? 認識主流:哪些模型生態值得關注? 掌握趨勢:從 2024 到 2026 的三階段演進。 建立判讀力:如何解讀改版新聞與評估模型?
<!-- notes: 快速介紹今天的學習地圖,讓學員對內容有整體的掌握。強調這不只是聽故事,更是要學會一套判斷方法,應用在未來的資訊判讀上。 --> 先分清楚:產品、模型與工具 {#先分清楚-產品-模型與工具}
理解 AI 改版新聞的第一步,是分清楚這幾個關鍵詞。
<!-- notes: 進入第一個單元。告訴學員,很多混亂的資訊都源於沒分清楚這些基本概念。接下來兩頁會幫大家打好基礎。 --> 產品、模型與專用工具的區別 {#產品-模型與專用工具的區別}
類別 意思 例子 --- --- --- 產品 使用者操作的服務 ChatGPT、Gemini App、Claude 模型 背後理解、推理與生成內容的系統 GPT-6 Astra、Gemini 3.8 Flash 專用生成產品 主要處理圖片、影片、聲音 ChatGPT Images、Gemini Flash Image 工作工具 結合模型、檔案與外部工具完成任務 Codex、Claude Code
<!-- notes: 逐一解釋表格中的每一項。可以用一個比喻:產品是「汽車」,模型是「引擎」,專用工具是「特定功能的車輛(如貨車、跑車)」。強調 ChatGPT 是產品名稱,不是單一模型。 --> 兩個容易混淆的例子 {#兩個容易混淆的例子} GPT-6 Astra 這是 OpenAI 在 2026 年 9 月推出的正式「模型」名稱。 ChatGPT Images 2.5 這是 OpenAI 的圖片生成「產品」名稱。它的版本號不跟 GPT 語言模型綁在一起。 注意:「GPT-5 Image 2.0」這類寫法,通常是使用者或媒體的誤用,應以官方名稱為準。
<!-- notes: 用這兩個具體案例,強化前一頁的觀念。提醒學員,看到新聞時,要先確認報導的主體是模型、產品還是功能,才不會產生錯誤的期待。 --> 認識八個主流模型生態 {#認識八個主流模型生態}
接下來,我們看看目前市場上幾個主要的玩家與他們的代表作。
<!-- notes: 進入第二個單元。說明這部分不是要大家背型號,而是要對主流的幾個「家族」有印象,知道他們各自的發展方向。 --> 主流模型生態概覽(節選) {#主流模型生態概覽-節選}
團隊 產品/家族 代表版本與分支 教學觀察重點 --- --- --- --- OpenAI ChatGPT/GPT GPT-5.x、GPT-5.6 (Sol/Terra/Luna)、GPT-6 Astra 程式、電腦操作、多步驟工作,以及能力與成本的選擇 Google Gemini App/Gemini Gemini 3.x (Pro/Flash/Live) Pro、Flash、Live 用途不同,不能只比版本數字 Anthropic Claude Sonnet 4.x/5、Opus 4.x/5 程式與長任務,各系列定位和存取條件不同 Meta Meta AI/Llama、Muse Llama 4、Muse Spark 系列 Llama 與 Muse 是不同家族,不能當成同一條版本線
<!-- notes: 由於模型眾多,這裡只列出四個代表性的生態。快速介紹每個團隊的特色,例如 OpenAI 強調工作代理,Google 整合搜尋與多模態,Anthropic 專注於長任務與程式,Meta 則在開放權重模型扮演重要角色。 --> 演進三部曲:從推理到分工 {#演進三部曲-從推理到分工}
從 2024 年下半年至今,AI 模型的能力演進可以歸納為三個主要階段。
<!-- notes: 進入第三個單元,也是本次分享的核心。預告接下來會按照時間順序,回顧過去兩年的重要里程碑,並提煉出每個階段的關鍵字。 --> [第一階段] 2024–2025:推理普及,代理加速 {#2024-2025-推理普及-代理加速} 2024 下半年:以 OpenAI o1-preview 為代表,模型開始投入更多運算進行「思考」,而不只是即時反應。 2025 全年:推理成為主流。GPT-5、Gemini 2.5、Claude 4 等改版,都將重點放在程式開發、工具使用與多步驟任務上。 意思是:AI 從「博學的回答者」進化成「能規劃與執行任務的實習生」。
<!-- notes: 解釋「推理」和「代理」的意思。推理就像是解數學題時,不只給答案,還會寫下計算過程。代理則是能幫你上網查資料、整理到試算表裡。這個階段的重點是 AI 開始「會思考、會動手」。 --> 金句 {#金句} 「比較 AI 時,除了回答品質,也要問它能否完成一份具體工作。」 — 本教材教學重點
<!-- notes: 讓這句話停留在畫面上幾秒鐘。引導學員思考:什麼是「一份具體工作」?例如「幫我把這五份 PDF 的重點整理成一份簡報草稿」,這就是一份工作,而不只是一個問題。 --> [第二、三階段] 2026:模型分工,成本決勝 {#2026-模型分工-成本決勝} 模型分工更細:GPT-5.6 推出 Sol、Terra、Luna 等分支,針對不同任務提供不同能力與成本的選擇。 流程成本更重要:Gemini 3.8 Flash、GPT-6 Astra 強調能完成複雜的企業流程與程式工程。 意思是:評估標準從「單一提示詞的表現」,轉向「完成整個工作流程的總成本」,包含時間、費用與人工介入。
<!-- notes: 說明 2026 年的趨勢是「專業化」與「經濟效益」。就像公司裡有不同職位的員工,AI 模型也開始分工。我們可以根據任務的複雜度和預算,選擇最適合的模型,而不是一味追求最強大的那一個。 --> [應用] 如何判讀模型改版新聞? {#如何判讀模型改版新聞}
看到「新版模型登場」,先問自己這五個問題:
::: steps 更新的是什麼? 是產品功能、模型權重、API,還是使用方案? 現在能用嗎? 是研究預覽、公開測試,還是已正式推出? 適合哪種任務? 是文字、程式、圖片理解,還是工具操作? 改進怎麼測得? 是官方數據、第三方評測,還是自己的真實任務? 總成本是多少? 除了 Token 費用,還包括等待、重試與人工校正的成本。 :::
<!-- notes: 這是本課程最重要的實用工具。帶領學員逐一念過這五個問題,並強調這是一個檢查清單,能幫助他們在資訊爆炸的時代,保持清醒的判斷力。 --> 課堂練習:比較兩款模型完成同一任務 {#課堂練習-比較兩款模型完成同一任務}
請挑選兩款你可用的模型,執行一個相同的具體任務。 任務範例:「將這三篇有來源的文章,整理成一頁比較表。」 記錄項目: 產品與模型名稱、測試日期 提示內容、資料範圍 完成時間、事實錯誤、來源可查證度 人工修改次數 注意:不要只投票選「看起來比較厲害」的,而要說明「哪一款更適合這個任務」,並提出證據。
<!-- notes: 說明這個練習的目標,是讓學員親身體驗「完成工作」與「回答問題」的差別。提醒他們,工具的搜尋能力、檔案權限等外部因素也要記錄下來,才能做出公平的比較。 --> 總結:帶走三個演進方向 {#總結-帶走三個演進方向} 2024 年下半年:推理與代理能力開始成形。 2025 年:推理普及,程式與工具協作成競爭重點。 2026 年至今:模型分工更細,工作流程的品質與總成本更重要。
模型版本號是識別名稱;真正要比較的是,它能否可靠地完成你的任務。
<!-- notes: 最後總結今天的三個重點,強化學員的記憶。再次呼應開頭的「從回答問題到完成工作」,並以一句強而有力的話結尾,鼓勵學員將今天的所學應用在實際工作中。最後開放 Q&A。 -->