2024~2026年,大家關注AI的焦點怎麼移轉
從比模型、到讓 AI 動手、再到怎麼管住它
一句話總結:AI 的焦點,從「模型有多聰明」,移到了「它能不能真的把事做完——而且做得穩、管得住、算得出錢」。
回頭看這兩年半,變化最大的其實不是模型分數,而是大家問的問題。2024 年大家問「哪個 AI 最強」,到了 2026 年,大家問的是「交給 AI 做的事,出錯時誰負責?」
下面分三年來看。 註:本文整理到 2026 年上半年為止。 2024:比模型的一年,AI 還是一個「聊天框」
打個比方,2024 年的 AI 像一位很會回答問題的新進顧問:問什麼都答得頭頭是道,但他不會自己去開電腦做事。
大家在看什麼 誰比較強:GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 輪流登上排行榜 Context 能放多長:一次能讀幾本書、幾小時影片 多模態:看得懂圖、聽得懂語音
大家怎麼用 ChatGPT 式的對話框 Copilot:在你旁邊幫你補一句、改一段 企業導入的標準做法是 RAG——把公司文件切塊存起來,讓 AI 回答前先去查
最熱門的技能是 Prompt Engineering:研究「怎麼問,AI 才會答得好」。
最大的擔心是幻覺(一本正經地胡說八道),還有「AI 會不會取代我的工作」。 2025:推理模型 + Agent 元年,AI 從「回答」變成「動手」
這一年發生了兩件大事。 第一件:AI 學會「先想再答」
OpenAI 的 o1、o3,以及 DeepSeek R1,證明了一件事:讓模型回答前多想一下,本身就能換到更強的能力。
這讓產業的重心從「訓練時砸多少算力」,部分移到「使用時讓它想多久」。
DeepSeek 還帶來另一個衝擊:它用遠低於外界想像的成本做出頂尖模型,而且開放權重。「只有少數巨頭做得出好模型」的想法被打破了。 第二件:AI 開始自己動手做事
新進顧問變成了會自己開電腦、查資料、寫程式的助理: Computer Use:AI 可以操作滑鼠鍵盤 Deep Research:丟一個問題,它自己上網查幾十個來源、整理成報告 寫程式的 Agent:Claude Code、Cursor、Codex 這類工具,從「幫你補一行」變成「幫你改完一整個功能」
Andrej Karpathy 在這一年提出 Vibe Coding 這個詞:用說的就能做出軟體。很多不會寫程式的人,開始自己做工具。 兩個不顯眼、但影響很大的轉變
① MCP 變成業界標準。 MCP 可以想成 AI 世界的 USB-C 插座——以前每接一個工具都要客製一條線,現在有了共同規格。Anthropic 提出後,OpenAI、Google 陸續跟進。
② Prompt Engineering → Context Engineering。 重點不再是「怎麼問」,而是「這一刻要給 AI 看哪些資料、給它哪些工具、訂哪些規則」。就像交辦工作給同事,關鍵不在你講話的語氣,而在你有沒有把背景資料給齊。 這一年的反省
年中開始出現「絕大多數企業 AI 試點沒有產生回報」的研究報告。熱潮之下,大家第一次認真問:所以到底賺到什麼? 2026 上半年:Agent 進入實際工作,問題變成「怎麼管」
助理已經能獨當一面了。新的問題是:他能碰哪些資料?做錯事怎麼辦?一個月到底花多少?
① 跑得更久
Agent 從「幫你做一步」,變成「連續跑幾十分鐘、甚至幾小時完成一件事」。也開始出現多個 Agent 分工合作。
② 穩定性比天花板重要
能做到 90 分的 demo 到處都是,但要穩定做到 99 分才上得了正式環境。差的那 9 分,才是真正的工程。所以「評測(evals)」從研究者的工具,變成每個團隊的基本功。
③ 資安與權限浮上檯面
AI 只會回答的時候,最壞的結果是答錯。AI 會動手之後,最壞的結果是做錯——刪錯資料、寄錯信、把不該看的東西讀進去。
Prompt injection(在網頁或文件裡藏指令,騙 AI 照做)從理論變成真實威脅。
④ 成本從「單價」變成「總量」
每個 token 越來越便宜,但 Agent 一跑就是幾十輪、幾萬 token。單價下降,總帳反而變大。企業開始需要知道:誰用了多少、用在哪裡、值不值得。
⑤ 生圖、生影片真正可用
人物一致性、局部修改做到了能放進工作流程的程度,不再只是「生一張好玩的圖」。 焦點轉移對照表
面向 2024 年 2025 年 2026 年 --- --- --- --- 比什麼 哪個模型最強 誰的推理能力強、誰的 Agent 能做事 哪個系統、工作流程最穩 AI 的角色 聊天、回答 動手:操作電腦、查資料、寫程式 長時間獨立完成任務、多個 Agent 分工 關鍵技能 Prompt 怎麼寫 Context 怎麼給、MCP 接工具 評測(evals)、流程設計 算力花在哪 訓練算力、參數量 推理算力(讓模型多想一下) 每完成一件事的總成本 怎麼判斷成敗 Demo 很驚艷 開始追問 ROI 上線後的可靠度與實際回報 最大的擔心 會不會幻覺 Agent 做錯事怎麼辦 權限、資安、稽核、誰負責 對工作的想像 AI 會不會取代人 Vibe Coding:不會寫程式也能做工具 工作怎麼重新分工、人留在哪個環節 模型生態 閉源模型領先 DeepSeek 衝擊,開源追上 模型逐漸商品化,像水電 誰在用 個人怎麼用 AI 團隊開始導入、試點 組織怎麼管 AI 從實作現場看到的三件事
我們自己在做企業內部的 AI 平台,這幾個轉變在實作現場都很具體:
1. 最先要處理的不是「AI 能做什麼」,而是「AI 能看什麼」。 個人的 AI 助理,不該讀到公司其他人的資料;公司的共用 AI,也不該讀到員工的私人信件和待辦。這條線畫不清楚,功能做得再好也不敢上線。
2. 讀取可以大方,寫入一定要守。 讓 AI「查」一個系統,風險有限;讓 AI「改」一個系統,每一個寫入功能都是一條繞過原本畫面限制的旁路。所以我們的原則是:寫入類的工具一律人工設計、逐支審過,不自動生成。
3. 用量控管要照順序來:先分得到人,再看得到,最後才管得住。 還沒有真實數據就先設額度,設多少都是猜的。 接下來,價值會在哪裡?
模型會越來越像水電——誰都拿得到,而且越來越便宜。
真正的護城河會落在三個地方: 專屬的 context:一家企業真實的資料、流程、權限結構,別人拿不到 信任機制:可稽核、可回溯,出錯時知道錯在哪一步 工作流程設計:知道哪一步交給 AI,哪一步一定要人確認
2024 年,「我們有接 AI」是賣點。
2026 年,「接了 AI 之後,出錯時管得住」才是。