重點解讀:
DeepSeek 不是第一次降價,但這一代把 Agent 最常用到的快取成本再大幅壓低,讓完成一項工作的總成本明顯下降。真正值得觀察的,不是模型單價有多便宜,而是「AI 員工」是否因此便宜到能大量部署。
2026年08月06日(優分析/產業數據中心報導)⸺ 2025 年初,DeepSeek-R1 以較低成本展現接近頂級模型的能力,打破市場原本認為「模型越強,成本一定越高」的印象,也迫使其他業者重新調整價格。
不過,AI 從聊天工具走向 Agent 後,成本問題又重新浮現。
一般聊天通常是一問一答;而 Agent 則要自己拆解任務、讀取資料、使用工具、檢查結果,再根據結果繼續下一步,一項工作可能要反覆呼叫模型數十次。
因此企業真正關心的,不再只是每 1M tokens 多少錢,而是 AI 完成一項工作總共要花多少錢。
V4 Flash 讓單次任務成本再減半
我們拿上一代 DeepSeek-V3.2,和最新的 V4 Flash 來看。
其中最明顯的是快取輸入價格,降至上一代的十分之一;一般輸入減半,輸出價格則下降約三分之一。

同級模型相比,差距更明顯

假設一項 Agent 工作累計使用量是 10M 一般輸入 tokens 與 1M 輸出 tokens。
V4 Flash 的成本已比 GPT-5.6 Luna 低約 48%,比 Gemini 3 Flash Preview 低約 79%,比 Claude Haiku 4.5 低約89%。
若其中 80% 的輸入可以命中快取,成本差距還會進一步擴大至 67%、87% 與 93%。
這裡的關鍵是:
聊天通常是一問一答,下一題就換了;Agent 是一件工作要跑很多步,每一步都要帶著相同的背景資料,所以很容易命中快取。
而快取,正是 DeepSeek V4 Flash 的強項。
一般輸入情境下,V4 Flash 已經明顯低於同級模型;進入高快取使用情境後,差距再擴大。
這一次市場要觀察的,是 DeepSeek 能否進一步證明,能夠實際完成工作的「AI員工」,也可以便宜到大量運作。
若 V4 Flash 能在真實工作中維持足夠的任務成功率,模型價格戰就不只是壓縮 API 單價,而可能直接替整個 AI 應用市場再添一把火。