DeepSeek-V3.1震撼登場:中國AI新星以128K上下文與混合推理架構挑戰科技巨頭

DeepSeek 推出 V3.1

筆者註:本文以 DeepSeek-V3.1 深度思考模式生成,未經任何增減與修改,讀者可以參考其文字能力及搜索深度判斷是否符合個人所需。有興趣的讀者可上 DeekSeek官方網站 體驗。

中文語音摘要

2025年8月21日,中國AI新創公司深度求索(DeepSeek)正式發布了其最新大語言模型DeepSeek-V3.1,這不僅是一次技術升級,更是對全球AI競爭格局的重新洗牌。

中國人工智能初創公司DeepSeek本周四(8月21日)宣布推出其V3模型的升級版本DeepSeek-V3.1,此次更新包含三大突破:混合推理架構、更高的思考效率以及更強的Agent(智能體)能力。

這意味著一個模型同時支持思考模式與非思考模式,讓用戶能夠根據問題複雜度自由切換處理方式。


01 三大升級:混合架構與效率飛躍

DeepSeek-V3.1最引人注目的特點是其混合推理架構設計。該模型實現了同時支持思考模式與非思考模式的單一模型架構。

用戶現在可以通過官方App和網頁端的“深度思考”按鈕,根據問題複雜度自由切換模式。面對簡單問題時,模型以非思考模式快速給出答案,而處理複雜問題時,則切換到思考模式,提供更具深度和邏輯的解答。

在思考效率方面,DeepSeek-V3.1表現顯著提升。官方數據顯示,與DeepSeek-R1-0528相比,V3.1在思考模式下能在更短時間內給出答案。

經過思維鏈壓縮訓練後,V3.1-Think在輸出token數減少20%-50%的情況下,各項任務的平均表現與R1-0528持平。

同時,V3.1在非思考模式下的輸出長度也得到有效控制,相比於DeepSeek-V3-0324,能够在輸出長度明顯減少的情況下保持相同的模型性能。

02 性能突破:編程能力超越Claude 4

根據社區使用Aider測試數據,V3.1在Aider Polyglot多語言編程測試中拿下了71.6%的高分,超越了Anthropic的Claude 4 Opus和多個知名模型。

模型名稱Aider Polyglot得分完成成本(美元)
DeepSeek-V3.171.6%1.01
Claude 4 Opus70.6%68.70
GPT-4.1-mini73.2%2.50
DeepSeek R165.8%0.85

這一成績令人印象深刻,因為它意味著DeepSeek-V3.1在編程任務上已經達到行業領先水平。更為難得的是,其完成一次完整編程任務的成本僅為1.01美元,成本效益優勢顯著。

在SVGBench基準測試中,V3.1的實力僅次於GPT-4.1-mini,遠超DeepSeek R1。這表明DeepSeek-V3.1在代碼生成和軟件工程任務上已經具有相當強的競爭力。

除了編程能力,DeepSeek-V3.1在搜索能力上也取得重大突破。官方表示,V3.1在多項搜索評測指標上取得了較大提升。

在需要多步推理的複雜搜索測試(browsecomp)與多學科專家級難題測試(HLE)上,DeepSeek-V3.1性能已大幅領先R1-0528。

03 技術架構:128K上下文與UE8M0 FP8精度

DeepSeek-V3.1將上下文窗口從原有的64K擴展至128K,意味著其可以處理更長篇幅的文檔和代碼。

對中文用戶而言,128K tokens大約相當於10萬-16萬漢字,足以處理整本《紅樓夢》正文的1/6-1/8,或者一篇超長博士論文。

在參數精度方面,DeepSeek-V3.1使用了UE8M0 FP8 Scale的參數精度。FP8是一種數據處理格式,能夠讓AI模型運行更高效,使用更少的內存,同時速度更快。

值得注意的是,DeepSeek在官方置頂留言中表示,UE8M0 FP8是針對即將發布的下一代國產芯片設計。這表明DeepSeek正在積極適配中國新興半導體生態系統,這在美國對中國技術出口限制日益嚴格的背景下顯得尤為重要。

04 成本優勢:高效能與低價格並存

儘管性能大幅提升,DeepSeek-V3.1卻保持了令人印象深刻的成本優勢。每次完整編程任務僅需1.01美元,成本僅為專有系統的六十分之一。

模型對比編程性能得分相對成本成本效益比
V3.1 vs Claude 4+1%1/6868倍
V3.1 vs GPT-4.1-mini-1.6%1/2.52.5倍

這一成本優勢使得DeepSeek-V3.1在競爭中具有明顯的性價比優勢。最鮮明的對比是,V3.1編程性能比Claude 4高1%,成本要低68倍。

不過,DeepSeek也宣布將對API接口調用價格進行調整。自北京時間2025年9月6日凌晨起,執行新版價格表並取消夜間時段優惠。

輸入價格方面,緩存命中時為0.5元/百萬tokens,緩存未命中時則漲至4元/百萬tokens(此前V3為2元/百萬tokens)。輸出價格調整為12元/百萬tokens(此前V3為8元/百萬tokens)。

05 多語言支持與應用場景

DeepSeek-V3.1在多語言支持方面进行了明顯的能力優化,目前能處理超過100種語言,尤其優化了亞洲語言和資源較少語種的運用。

這意味著V3.1能夠更好地服務全球用戶,特别是在中文處理方面,DeepSeek一直保持著優勢。

在應用場景方面,DeepSeek-V3.1展現出強大的Agent能力。通過Post-Training優化,新模型在工具使用與智能體任務中的表現有較大提升。

具體來說,在編程智能體方面,在代碼修復測評SWE與命令行終端環境下的複雜任務(Terminal-Bench)測試中,DeepSeek-V3.1相比之前的DeepSeek系列模型有明顯提高。

在搜索智能體方面,V3.1在多項搜索評測指標上取得了較大提升。這些增強使得DeepSeek-V3.1能夠在更複雜的應用場景中發揮作用,如金融分析、醫療診斷等領域。

06 市場反應與競爭格局

DeepSeek新模型一經推出,便在技術社區擁有超人氣和關注度,一舉衝到HuggingFace趨勢榜第三。

即便尚未公布模型卡,DeepSeek V3.1就已經在Hugging Face的趨勢榜上排到了第四,顯示出社區對這一新模型的極高期待。

然而,雖然V3.1在多個方面有進步,但部分功能體驗也受到網友詬病。多名測試者反饋,V3.1在數學推理、邏輯分析等綜合推理任務中無明顯進步,甚至在部分場景下表現不及舊版。

也未看到“幻覺”問題的改善跡象,還出現了“中英文混雜”的新問題。在一些特定領域,如研究生級基準問答、軟件工程的某些複雜場景中,與頂尖模型如GPT-5相比仍有一定差距。

根據ArtificialAnalysis最新大模型排名榜單,DeepSeek已從昔日“領跑”變為“中游”水平,OpenAI、Google、阿里巴巴等競爭對手躍至前位。

07 挑戰與機遇:DeepSeek的發展前景

儘管DeepSeek-V3.1表現強勁,但公司仍然面臨多方面挑戰。據QuestMobile在《2025年二季度AI應用價值榜》中提到,DeepSeek月均下載量從第一季度的8111.3萬猛降至2258.9萬,下滑超過70%。

時間段月均下載量(萬)活躍用戶規模(萬)環比變化
2025年3月8111.31936.1–
2025年6月2258.91629.5下滑70%

活躍用戶規模方面,從2025年3月的1936.1萬降至6月的1629.5萬,下滑趨勢明顯。這表明DeepSeek在維持用戶黏性方面面臨挑戰。

不過,DeepSeek仍有市場潛力,其開源模型被騰訊、字節跳動、阿里、百度等眾多第三方平台廣泛接入。據估算有超過70%的DeepSeek模型調用量發生在這些第三方平台。

Token消耗量上,DeepSeek系列7月31日單日總Token用量達到70.5B,6月29日單日總Token用量達到54B,環比增長接近31%。這表明盡管官方流量下滑,但通過第三方平台的使用量仍在增長。

第三方機構onelittleweb分析顯示,就其全球市場表現而言,DeepSeek模型以3.96%的市場份額在全球AI聊天機器人中綜合評分排名第五,年度訪問量達27.4億次。


隨著DeepSeek-V3.1的發布,中國AI公司再次證明了自己在全球競技場上的實力。這家由幻方量化孵化的初創企業,憑藉技術創新與成本優勢,正在改寫全球AI競爭的規則。

雖然面臨用戶增長放緩與國際競爭加劇的挑戰,但DeepSeek通過與國產芯片適配的戰略布局,以及被國內科技巨頭廣泛接入的生態優勢,正在開辟一條獨特的發展路徑。