本期目錄
GPT-5.4 反擊 Anthropic 五角大廈風波 Claude Code 稱王 Code Review 已死 Cursor 雲端 Agent Cline 供應鏈攻擊 Qwen 團隊崩解 Knuth 改口 全球經濟風暴 行動建議 參考來源
GPT-5.4:OpenAI 史上最全面的一次反擊
| 指標 | 數據 |
|---|---|
| Token 上下文長度 | 1M |
| 投行試算表任務得分 | 87.3%(GPT-5.2 僅 68.4%) |
| OSWorld 電腦操作 | 75%(人類基線 72.4%) |
| SWE-Bench Pro 程式修復 | 57.7% |
OpenAI 這週放了一個大招:GPT-5.4 是第一個把 Codex 級編程能力融入主線模型的版本。之前 GPT-5.3 Codex 只專精寫程式,但 5.4 同時在知識工作(試算表、簡報、文件分析)和程式碼上都達到了新標準。
更重要的是,電腦操作(Computer Use)成為原生能力——模型不只是生成文字,還能直接操作螢幕上的 GUI,打開應用程式、填表格、點按鈕。OSWorld 測試中得分 75%,超過人類基線 72.4%。
Latent Space 的評價最到位:「我們在試用 5.4 時不小心忘了切回 Opus,結果完全沒注意到差異。」這代表 OpenAI 終於追上甚至超越 Claude Opus 在日常工作中的表現。
關鍵細節: 5.4 Pro 和 5.4 同天發佈(以前 Pro 通常晚幾週)。272K token 以上有加價。知識截止日期是 2025 年 8 月 31 日。GDPval 測試中,5.4 在 69-71% 的情境下勝過領域專家。
同時,OpenAI 發布了 Codex Security——一個 AI 應用安全 Agent,能分析專案上下文來偵測、驗證並修補複雜漏洞。這是 AI 不只寫程式、還能保護程式的重要一步。
ChatGPT for Excel 也正式發布,搭配財務數據整合。GPT-5.4 能直接在 Excel 裡做投行級的建模和分析——這對金融業是重大衝擊。
Anthropic 的雙面戰場:五角大廈 vs 消費市場
本週 Anthropic 最大的新聞不是技術,而是政治。
五角大廈正式將 Anthropic 列為「供應鏈風險」,原因是雙方在 AI 模型控制權上談不攏——軍方想要無限制使用 Claude,包括自主武器和大規模國內監控,Anthropic 拒絕了。2 億美元的合約就此破裂。
AI 模型正在快速商品化。Anthropic、OpenAI、Google 的頂級模型性能差不多,每隔幾個月就互相超車一小步。在這樣的市場裡,品牌定位非常重要。Anthropic 正在把自己定位為「道德且可信賴的 AI 供應商」——這對消費者和企業客戶都有市場價值。
— Bruce Schneier & Nathan E. Sanders
諷刺的是,Claude 的消費者增長反而加速了。TechCrunch 報導 Claude App 的新安裝量已超過 ChatGPT,日活用戶持續攀升。Anthropic 的年營收已達 $19B ARR(對比 OpenAI 的 $25B)。
另一個重磅:Claude 在兩週內找到了 Firefox 的 22 個漏洞,其中 14 個被歸類為「高嚴重性」。這是 Anthropic 與 Mozilla 的安全合作成果,也是 AI 在安全領域實用性的最佳案例。
開發者工具大洗牌:Claude Code 稱王
The Pragmatic Engineer 做了一個 900+ 人的調查,結論非常明確:
| 指標 | 數據 |
|---|---|
| Claude Code 登頂耗時 | 僅 8 個月 |
| 工程師每週使用 AI 工具 | 95% |
| 最受歡迎工具:Claude Code | 46% |
| 用 AI 完成 70%+ 工作 | 56% |
Claude Code 從零到第一只花了 8 個月,超越了 GitHub Copilot(穩定但沒增長)和 Cursor(成長 35% 但仍居第二)。關鍵數據:
- Staff+ 工程師是 Agent 最大使用者(63.5%),比一般工程師高 14%
- 公司規模影響工具選擇:小公司 75% 用 Claude Code,大企業 56% 用 Copilot(因為採購流程)
- Director 和 VP 特別愛 Claude Code,是低階職位的兩倍
- **Codex(OpenAI 的 CLI Agent)**爆發式增長,已達 Cursor 60% 的使用量
- 用 Agent 的人對 AI 的興奮程度是不用的人的兩倍
Boris Cherny 談 Claude Code 的構建
Claude Code 的創造者 Boris Cherny 在 Pragmatic Engineer 播客分享了幾個重要觀察:
- 他每天用 5 個平行 Claude 實例發 20-30 個 PR——先用 plan mode 反覆調整計畫,然後讓 Claude 一次性實作。「一旦計畫夠好,它幾乎每次都能一次完成。」
- Claude Code 的搜索用的就是 glob 和 grep,打敗了 RAG、向量資料庫和各種花俏方案。簡單暴力最有效。
- PRD 已死——Claude Code 團隊不寫需求文件了,直接做大量原型。「如果我們從 Figma 或 PRD 開始,絕對不可能這麼快出貨。」
- Claude Cowork 只花 10 天就做出來了,目標是非工程師使用者。主要工程量不在產品邏輯,而在安全性(分類器、VM 隔離、OS 級防護)。
- 軟體工程師是現代的「抄寫員」? 中世紀抄寫員在印刷術發明後「失業」,但很多人變成了作家,書寫市場爆炸性增長。Boris 認為軟體工程師可能也在經歷同樣的轉變。
Anthropic 的文化細節: 所有人頭銜都是「Member of Technical Staff」——沒有 PM、沒有 Designer、沒有 EM。每個人什麼都做。這也是 Claude Code 能快速迭代的原因之一。
Code Review 已死?新時代的品質把關
Latent Space 發了一篇爭議性文章:人類寫的程式碼在 2025 年就死了,Code Review 會在 2026 年死掉。
核心論點:AI 高度採用的團隊完成的任務多了 21%、合併的 PR 多了 98%,但 PR review 時間增加了 91%。程式碼量和變更大小都在指數增長,人類已經不可能讀完所有程式碼了。
作者提出的替代方案是**「Spec-Driven Development」**:
- 人類審查意圖,不審查程式碼——審 spec、plan、constraint、acceptance criteria
- Layer 1:讓多個 Agent 競爭,選最好的結果
- Layer 2:確定性護欄——測試、型別檢查、合約驗證。Agent 無法跟失敗的測試「協商」
- Layer 3:BDD(行為驅動開發)重新崛起——spec 不再是「額外工作」,而是主要產出物
- Layer 4:權限系統成為架構決策——修 bug 的 Agent 不需要碰 CI pipeline
同時,GitHub 宣布 Copilot 已完成 6000 萬次 Code Review。AI review 不是在取代人類 review,而是在幫助團隊跟上 AI 加速產生的程式碼量。
Cursor 的第三紀元:雲端 Agent 時代
Cursor(估值 $50B)宣布雲端 Agent 的使用量已超過傳統的 IDE tab 補全功能——他們稱之為「軟體開發的第三紀元」。
三大支柱:
- Agent 自己測試:模型不只寫程式碼,還會啟動 server、跑測試、反覆修正。PR 交付時已經驗證過了
- 影片回顧:Agent 完成後錄一段操作影片。看影片比讀 diff 容易得多
- 完整的遠端控制:你可以直接進入 VM,滑鼠點擊、鍵盤輸入,完全接管
Cursor 收購了 Graphite(Git 工具)和 Autotab(Computer Use 先驅),正在打造一個完整的「Agent Lab」。
未來的重大突破不是一個人配一個模型做更多,而是把水管變粗——平行 Agent、Agent 群、同時做更多事。
— Jonas(Cursor 聯合創辦人)
值得注意的是,不同模型供應商的 Agent 「協同」效果比單一供應商更好。Cursor 發現混用不同家的模型在 Best-of-N 策略下能產生比單一模型更好的結果。
供應鏈安全警報:一個 Issue 標題感染 4000 台電腦
本週最令人不安的安全事件:Cline(一個知名的 AI 編程助手)的生產版本被攻擊者透過一個 Issue 標題就滲透了。
攻擊鏈非常精巧:
- 攻擊者在 Cline GitHub repo 開了一個 Issue,標題裡藏了 Prompt Injection
- Cline 使用 Claude Code Action 做自動化 Issue 分類,會執行 Bash 命令
- 被注入的指令讓 Claude 執行了
npm install一個惡意套件 - 惡意套件的 preinstall script 塞了 11GB 垃圾到 GitHub Actions Cache
- GitHub 的快取超過 10GB 自動清除舊快取——攻擊者用新的毒化快取取代了原本的
node_modules - Cline 的夜間發布 workflow 共享同一個 cache key,載入了被毒化的快取,攻擊者拿到了 NPM 發布的 secret
- cline@2.3.0 被攻擊者發布了(後來已撤回)
Cline 在收到負責任揭露報告後沒有及時處理,導致被真正攻擊。幸運的是,攻擊者只加了 OpenClaw 安裝,沒做更危險的事。
教訓:
- AI 驅動的 Issue 分類器不能有執行 shell 命令的權限
- GitHub Actions 的 cache key 在不同 workflow 之間不應共享
- 任何接收使用者輸入的 AI Agent 都必須做Prompt Injection 防護
- 安全揭露必須立即處理,不能拖延
Qwen 3.5 團隊崩解:開源 AI 最大危機
阿里巴巴旗下的 Qwen 團隊正在崩解。技術負責人林俊陽在 X 上突然宣布辭職:「me stepping down. bye my beloved qwen.」
隨後多位核心成員也宣布離開:
- Binyuan Hui:領導 Qwen-Coder 系列,負責 Agent 訓練
- Bowen Yu:領導 Qwen 後訓練研究,開發 Instruct 系列
- Kaixin Li:Qwen 3.5/VL/Coder 核心貢獻者
據 36Kr 報導,導火線是阿里巴巴從 Google Gemini 團隊挖來了新主管接管 Qwen。阿里巴巴 CEO 吳永明親自出席了緊急全員會議。
這件事打擊特別大,因為 Qwen 3.5 是近期最出色的開源模型家族。從 2 月 17 日開始,他們發布了 8 個尺寸的模型(397B 到 0.8B),其中:
- 27B 和 35B 在 Mac 上的編程任務表現優異
- 2B 模型只有 4.57GB(量化後 1.27GB),卻是完整的推理+多模態(視覺)模型
- 在資源遠少於競爭對手的情況下取得這些成果
如果核心成員開始新計畫或加入其他實驗室,我很期待看到他們的下一步。但如果 Qwen 團隊就此解散,那將是開源 AI 的一大損失。
— Simon Willison
Donald Knuth 改口了:承認 AI 的創造力
計算機科學之父 Donald Knuth 寫了一段話,在社群引發巨大迴響:
震驚!震驚!我昨天得知我花了幾週研究的一個開放問題,剛剛被 Claude Opus 4.6(Anthropic 三週前發布的混合推理模型)解決了!看來有一天我得修正我對「生成式 AI」的看法了。能知道我的猜想有一個漂亮的解答,同時見證自動推理和創造性問題求解的戲劇性進展,真是一件快樂的事。
— Donald Knuth,《Claude's Cycles》
Knuth 長期以來對 AI 持保守態度。他公開承認 Claude Opus 4.6 解決了他正在研究的數學問題,這是一個里程碑式的背書。
全球經濟:中東戰火推油價破 $90、美國失業劇增
中東局勢急劇升溫
布蘭特原油衝破 $90/桶,是伊朗戰爭以來首次。荷莫茲海峽的船隻通行幾乎停擺。關鍵發展:
- 卡達警告:戰爭將迫使波斯灣在「數天內」停止能源出口,恢復需「數週到數月」
- 油輪費率飆升:美國原油出口商被迫使用小型船隻
- 至少 10 艘船隻在海灣宣稱自己是「中國船」以避免被攻擊
- 俄羅斯正協助伊朗瞄準美軍資產(FT 報導)
- 全球債券遭遇數年來最大拋售,能源價格飆升引發通膨恐慌
- Bloomberg 分析師討論油價是否會突破 $200/桶
美國就業市場震撼
2 月美國經濟意外流失 92,000 個工作機會——這是疫情以來最大的單月降幅之一,遠低於市場預期。華爾街震驚。
關稅混亂
- 法官下令美國政府開始退還超過 $1,300 億的非法關稅(最高法院已裁定 Trump 的關稅違法)
- 但海關官員正在拒絕退款申請
- Nintendo 正式起訴美國政府,要求退還已繳關稅加利息
- 科技業仍深陷關稅地獄——即使退款自動化,物流和定價混亂仍在持續
金融市場
- BlackRock 限制其 $260 億私募信貸基金的贖回——客戶申請贖回量飆至淨資產價值的 9.3%
- PIMCO 警告私募債務將面臨「全面違約週期」
- Fed Cleveland 主席 Hammack 表示利率可能長時間維持不變
AWS 歷史首次:無人機攻擊導致雲端服務中斷
巴林和阿聯酋的無人機攻擊導致 AWS 資料中心部分或完全下線——這是歷史上第一次軍事打擊導致雲端服務中斷。
我的行動建議
本週最重要的訊號:開發者工具正在從「輔助寫程式」轉向「Agent 自主開發」。
立即行動
- 檢查你的 GitHub Actions 安全性:確保 AI 驅動的 workflow(如 auto-pr-review)沒有過大的權限,cache key 要跟發布 workflow 分開
- 試用 GPT-5.4:特別是 Computer Use 能力。如果它真的能操作 GUI,對你的測試自動化會是大躍進
- 關注油價走勢:如果中東衝突擴大,可能影響你的投資部位和客戶預算
中期思考
- Spec-Driven Development:考慮把你的 prd-workflow 升級為更嚴格的 BDD 流程。未來的品質把關會在 spec 階段,不在 code review 階段
- Boris 的工作流是你的標杆:5 個平行 Claude 實例、plan mode 先行、一次性實作。你已經在做類似的事,但可以更系統化
- Qwen 3.5 值得關注:如果團隊穩定下來,他們的小模型(2B-27B)對本地推理和低成本應用很有價值
長期趨勢
- AI 已是主流:95% 的工程師每週用 AI,56% 用 AI 完成 70%+ 工作。不用 AI 的人將成為少數
- IDE 正在死亡:Cursor 的數據顯示雲端 Agent > tab 補全。未來的「IDE」是一個 Agent 管理介面
- Knuth 的改口是風向標:連最保守的學術權威都承認 AI 有創造力了。阻力會越來越小
參考來源
本文所有資訊均來自以下外媒原始報導,經 AI 綜合消化後編輯而成。
GPT-5.4
- Introducing GPT-5.4 — OpenAI Blog (03/05)
- GPT-5.4 Thinking System Card — OpenAI (03/05)
- Codex Security: now in research preview — OpenAI (03/06)
- Introducing ChatGPT for Excel and new financial data integrations — OpenAI (03/05)
- [AINews] GPT 5.4: SOTA Knowledge Work -and- Coding -and- CUA Model — Latent Space (03/06)
- Introducing GPT-5.4 — Simon Willison (03/06)
Anthropic 五角大廈 vs 消費市場
- Anthropic and the Pentagon — Simon Willison / Bruce Schneier & Nathan Sanders (03/07)
- Claude's consumer growth surge continues after Pentagon deal debacle — TechCrunch (03/07)
- Anthropic's Pentagon deal is a cautionary tale for startups chasing federal contracts — TechCrunch (03/07)
- Anthropic's Claude found 22 vulnerabilities in Firefox over two weeks — TechCrunch (03/07)
- Microsoft: Anthropic Claude remains available except Defense Department — TechCrunch (03/07)
- [AINews] Anthropic @ $19B ARR, Qwen team leaves — Latent Space (03/04)
- When AI Companies Go to War, Safety Gets Left Behind — Wired (03/07)
- OpenAI's "compromise" with the Pentagon is what Anthropic feared — MIT Technology Review (03/03)
開發者工具:Claude Code 稱王
- AI Tooling for Software Engineers in 2026 — The Pragmatic Engineer (03/04)
- Building Claude Code with Boris Cherny — The Pragmatic Engineer (03/05)
Code Review 已死
- How to Kill the Code Review — Latent Space (03/03)
- 60 million Copilot code reviews and counting — GitHub Blog (03/06)
- Anti-patterns: things to avoid — Simon Willison (03/05)
Cursor 第三紀元
- Cursor's Third Era: Cloud Agents — Latent Space (03/06)
供應鏈安全:Cline 攻擊事件
- Clinejection — Compromising Cline's Production Releases just by Prompting an Issue Triager — Simon Willison / Adnan Khan (03/06)
- Agentic manual testing — Simon Willison (03/06)
Qwen 3.5 團隊崩解
- Something is afoot in the land of Qwen — Simon Willison (03/04)
- Junyang Lin has left Qwen :( — Reddit r/LocalLLaMA (03/04)
- Alibaba CEO: Qwen will remain open-source — Reddit r/LocalLLaMA (03/05)
- Final Qwen3.5 Unsloth GGUF Update — Reddit r/LocalLLaMA (03/05)
Donald Knuth 改口
- Quoting Donald Knuth — Simon Willison (03/04)
全球經濟
- How Much Higher Can Oil Go? — Bloomberg (03/07)
- Oil surges above $90 a barrel for first time in Iran war — Financial Times (03/07)
- Qatar warns war will force Gulf to stop energy exports 'within days' — Financial Times (03/06)
- US economy sheds 92,000 jobs in February in sharp slide — Financial Times (03/06)
- US Payrolls Shock Wall Street — Bloomberg (03/07)
- Ships in Gulf declare themselves Chinese to dodge attack — Financial Times (03/07)
- Russia is helping Iran to target US military assets in Middle East — Financial Times (03/07)
- Global bonds suffer one of worst routs in years — Financial Times (03/07)
- BlackRock $26B Private Credit Fund Limits Withdrawals — Bloomberg (03/07)
- Private Debt Should Face 'Full-Blown Default Cycle,' Pimco Says — Bloomberg (03/07)
- Fed's Hammack Says She Sees Two-Sided Risks to Interest Rates — Bloomberg (03/07)
- Nintendo is suing the US government for a refund of Trump's illegal tariffs — The Verge (03/07)
- Tech industry is in tariff hell, even if refunds are automated — Ars Technica (03/06)
- The Pulse: AWS region knocked offline by drone attack in historic first — The Pragmatic Engineer (03/06)
其他值得關注
- Can coding agents relicense open source through a "clean room" implementation? — Simon Willison (03/06)
- Reasoning models struggle to control their chains of thought, and that's good — OpenAI (03/05)
- LangChain Skills — bumps Claude Code performance from 29% to 95% — LangChain Blog (03/05)
- The design process is dead — Jenny Wen (head of design at Claude) — Lenny's Newsletter (03/01)
- We Have 30 AI Agents in Production — Top 5 Issues No One Talks About — SaaStr (03/04)
- On-device speech toolkit for Apple Silicon — ASR, TTS, diarization in Swift — Reddit r/MachineLearning (03/06)
- Apple unveils M5 Pro and M5 Max — up to 4x faster LLM prompt processing — Reddit r/LocalLLaMA (03/03)
