DeepSeek 火箭般竄升!Andreessen Horowitz 公布 2025 年全球生成式 AI 消費級應用排行榜

DeepSeek 火箭般竄升!Andreessen Horowitz 公布 2025 年全球生成式 AI 消費級應用排行榜

全球知名投資基金 Andreessen Horowitz (a16z) 近期發布了 2025 年全球百大生成式 AI 應用排行榜。這份榜單分為網頁版和行動版,各列出 50 個生成式 AI 應用程式。DeepSeek 在網頁版排名中位居第二,僅次於 ChatGPT,在不到兩個月的時間內取得了驚人的成就。 更令人驚嘆的是,DeepSeek 在 2 月份已躍升至行動版第二名,佔據了 ChatGPT 行動用戶群的 15%。 DeepSeek 的快速崛起不僅震驚了科技界,也引發了關於中美之間在 AI 領域經濟和地緣政治競爭的討論。風險投資家 Marc Andreessen 甚至將 DeepSeek R1 比作 AI 的「史普尼克時刻 (Sputnik moment)」,認為這標誌著中國 AI 技術的崛起對美國構成了重大挑戰。

 Top 100 Gen AI Consumer Apps
圖片來源:a16z

ChatGPT 仍然佔據主導地位,但競爭加劇

儘管 DeepSeek 來勢洶洶,但 ChatGPT 仍然是生成式 AI 領域的霸主,在網頁版和行動版排名中均位居第一。ChatGPT 的每週活躍用戶數在不到六個月的時間裡翻了一番,達到 4 億。然而,隨著 DeepSeek 等新興 AI 應用程式的崛起,ChatGPT 的主導地位正面臨越來越大的挑戰。AI 影片模型的進步、開發者工具的普及和 AI 陪伴平台的興起,都為消費者提供了更多選擇。生成式 AI 消費級應用市場的競爭正在加劇,未來的發展充滿了變數。

DeepSeek:異軍突起的 AI 挑戰者

DeepSeek 由中國對沖基金幻方量化(High-Flyer)於2023年7月創立,總部位於中國杭州。DeepSeek 的成功可以歸因於其高效且具有高度競爭力的 AI 模型,這些模型在成本效益方面優於美國的競爭對手,例如 OpenAI。 DeepSeek 的模型採用「開放權重」策略,雖然不如真正的開源軟體自由,但仍允許一定程度的修改。DeepSeek 強調計算效率,部分原因是受到美國對先進 AI 晶片制裁的限制。

DeepSeek 的首席執行官梁文峰是一位數學天才,他將 DeepSeek 的成功歸功於公司對 AI 學習的專注和決心。 DeepSeek 沒有對外尋求融資,而是由幻方量化全額資助,這使得 DeepSeek 能夠專注於 AI 研究,而不必擔心投資者的短期利益。梁文峰曾在 2023 年表示,DeepSeek 的目標是通用人工智能(AGI),即超越人類認知能力的 AI。他認為,在 OpenAI 鋪平道路後,所有 AI 公司都在使用已發表的論文和開源程式碼,因此新創公司完全有能力與老牌公司競爭。

DeepSeek 的崛起也凸顯了中國在 AI 領域的雄心壯志。中國政府大力支持 AI 發展,通過風險基金、補貼和稅收優惠措施提供了大量資金。中國還建立了數據交易所和「可信數據空間」,為 AI 公司提供受監管的數據獲取管道。 DeepSeek 正是利用了中國豐富的數據資源和政策支持,走出了一條獨特的 AI 發展道路。

DeepSeek 的獨特競爭優勢

  1. 高效的訓練方法: DeepSeek 採用創新的訓練方法,例如在沒有監督微調的情況下使用強化學習,從而顯著降低了訓練成本和所需的計算能力。 DeepSeek-V3 的訓練成本僅為 600 萬美元,而 OpenAI 的 GPT-4 在 2023 年的訓練成本則高達 1 億美元。此外,DeepSeek-V3 只使用了 Meta 可比模型 Llama 3.1 十分之一的計算能力。
  2. 開放權重模型: DeepSeek 的模型採用「開放權重」策略,允許一定程度的修改,這有助於促進 AI 技術的發展和應用。
  3. 專注於研究: DeepSeek 目前主要專注於 AI 研究,尚未制定詳細的商業化計劃。這使得 DeepSeek 能夠避免中國嚴格的 AI 法規,例如要求面向消費者的技術遵守政府對資訊的控制。
  4. 獨特的招聘策略: DeepSeek 的招聘策略優先考慮技術能力和多元化的知識背景,而不是傳統的電腦科學經驗。DeepSeek 從中國頂尖大學招募 AI 研究人員,並聘用電腦科學領域以外的人才,以使其模型的知識和能力更加多樣化。

這些因素共同促成了 DeepSeek 的快速崛起,使其成為 AI 領域的一匹黑馬。

DeepSeek 的崛起對美國科技巨頭的影響

DeepSeek 的低成本 AI 模型引發了美國科技股市的震盪,一些觀察家擔心 DeepSeek 的技術進步會削弱美國在 AI 領域的領先地位。 DeepSeek 的成功也可能削弱美國限制向中國出售 AI 晶片的策略。 然而,Nvidia 對 DeepSeek 的工作表示讚賞,並強調其使用了符合出口管制規定的技術。

DeepSeek 的產品和服務

DeepSeek 主要提供大型語言模型 (LLM),包括 DeepSeek-R1、DeepSeek-V2 和 DeepSeek-V3。 DeepSeek-R1 的表現可與 OpenAI 的 GPT-4o 和 o1 等其他當代大型語言模型相媲美。據報導,其訓練成本明顯低於其他 LLM 。 DeepSeek-R1 還展現出先進的「推理」能力,例如能夠重新思考解決數學問題的方法。 DeepSeek 的 AI 模型用途廣泛,可用於內容創作、影片製作,甚至 SEO 服務。

DeepSeek 通過多種方式獲利:

  1. 量化交易: DeepSeek 的母公司幻方量化專注於量化交易,利用 AI 驅動的演算法分析金融市場並執行交易。這些交易活動產生的利潤為 DeepSeek 的 AI 研發提供了大量資金。幻方量化在 2021 年管理的資產超過 1000 億人民幣(約 140 億美元)。
  2. API 服務: DeepSeek 提供其先進 AI 模型的 API 訪問權限。 DeepSeek 採用基於 token 的定價結構,根據處理的輸入和輸出 token 數量收費。 token 可以是單詞、數字或標點符號。定價取決於所使用的模型以及是否使用上下文快取。

生成式 AI 消費級應用市場的蓬勃發展

生成式 AI 消費級應用市場正在快速增長。ABI Research 的最新報告顯示,生成式 AI 軟體市場規模預計將從 2023 年的 104.5 億美元增長到 2030 年的超過 1760 億美元,複合年增長率 (CAGR) 接近 50%。預計到 2030 年,生成式 AI 軟體的年收入將達到 1760 億美元。中國生成式 AI 解決方案的複合年增長率預計將達到 56%,為全球最高。設備端 AI 收入預計在 2024 年至 2030 年之間增長 25 倍。 Sensor Tower 的數據顯示,2024 年消費者在生成式 AI 應用程式上的支出達到近 11 億美元,年增長率高達 200%。非遊戲應用程式的消費支出增長速度連續第四年超過遊戲應用程式。

生成式 AI 應用在各個領域都取得了進展:

  • AI 影片: AI 影片在過去六個月中取得了重大進展,Hailuo、Kling AI 和 Sora 等新公司紛紛進入 Andreessen Horowitz 的排行榜。這些公司在影片生成品質和可控性方面取得了突破。 Hailuo 以其對 prompt 的高度依從性而聞名,而 Kling 則提供額外的功能,例如鏡頭移動控制和唇形同步。 AI 影片剪輯仍然是生成式 AI 的一個重要應用場景,它將智慧剪輯、字幕和其他耗時的流程簡化為「一鍵式」解決方案。 Veed 和 Clipchamp 進入了網頁版排名,而行動版則以混合影片照片編輯應用程式為主,例如 B612、VivaCut 和 Filmora。
  • 開發者工具: Cursor 等代理 IDE 作為開發人員的輔助駕駛,提供錯誤檢查、自動完成和完整程式碼生成等功能。 Cursor 在 Andreessen Horowitz 的網頁版排名中首次亮相,排名第 42 位。
  • AI 陪伴: Character.AI 等 AI 陪伴平台越來越受歡迎,提供友誼、指導和娛樂等多方面的陪伴體驗。

生成式 AI 正在改變消費者使用行動裝置的方式

AI 正在影響消費者使用行動裝置的方式,跨裝置連接用戶或與實體體驗相關的應用程式類別正在增長。例如,隨著越來越多的公司將應用程式整合到整體客戶體驗中,餐飲應用程式的下載量同比增長了 8.5%。同樣,以數位錢包和行動銀行業務的普及為首的金融應用程式,下載量同比增長 8%,達到 75 億次,使用時間也增加了 21%。

生成式 AI 在各個產業的應用

生成式 AI 正在被各個產業廣泛採用,包括:

  • 行銷業: 預計到 2030 年,生成式 AI 在行銷領域的全球市場規模將達到 266 億美元,複合年增長率為 35.4%。生成式 AI 被用於個性化行銷、內容創作和客戶互動等方面。
  • 零售和電子商務: 預計到 2030 年,零售和電子商務將佔生成式 AI 創造的企業價值的 33%。該產業將利用 AI 驅動的技術,例如視覺搜尋工具、增強型聊天機器人和自動化網站優化。
  • 金融服務業: 作為傳統 AI 的最大用戶之一,金融服務業預計到 2030 年將佔生成式 AI 創造的企業價值的 20% 左右。生成式 AI 在該領域的應用將集中於股票市場分析、網路安全改進和自動化客戶溝通。
  • 客戶服務: 預計到 2030 年,AI 客戶服務市場將從 2024 年的 120.6 億美元增長到 478.2 億美元,複合年增長率為 25.8%。AI 驅動的聊天機器人、虛擬助理和其他工具被用於提升客戶體驗。

Andreessen Horowitz 的研究方法

Andreessen Horowitz 的 2025 年全球百大生成式 AI 應用排行榜基於以下方法:

  • 數據來源: 網頁版排名主要基於 SimilarWeb 提供的每月不重複訪問次數,篩選出排名前 50 的生成式 AI 應用程式;行動版排名則基於 Sensor Tower 提供的每月活躍用戶數,同樣篩選出排名前 50 的應用程式。
  • 標準: 該排名僅包含 AI 優先的應用程式,即以 AI 技術為核心的應用程式。那些添加了重要生成式 AI 功能但並非 AI 原生的產品,例如 Canva 和 Notion,則未包含在排名中。
  • 限制: 該排名不包括僅限應用程式的公司,也不包括 Discord 伺服器內的活動。

專家評論

ABI Research 首席分析師 Reece Hayden 預測,生成式 AI 軟體市場將快速增長,硬體和軟體都將有很高的期望。他認為,生成式 AI 具有重塑各種業務功能的能力,從自動化日常任務到創造全新的產品。

Sensor Tower 首席執行官兼聯合創始人 Oliver Yeh 表示,隨著消費者在行動裝置上花費更多時間,他們越來越習慣在裝置上購物。他認為,應用程式已經改變了其獲利策略,以利用這種日益增長的注意力,尋找創新的方法來簡化和改善消費者的數位體驗。

結語

DeepSeek 的崛起標誌著生成式 AI 領域新時代的到來。DeepSeek 的成功不僅證明了新創公司在 AI 領域挑戰行業巨頭的可能性,也凸顯了中國在 AI 領域的雄心壯志和快速發展。隨著 AI 技術的快速發展和應用場景的不斷擴展,生成式 AI 消費級應用市場將迎來更加蓬勃的發展。未來,生成式 AI 應用程式將在各個領域發揮更大的作用,為消費者帶來更多便利和創新體驗。

DeepSeek 的崛起也對全球 AI 格局產生了深遠的影響。它加劇了中美之間的 AI 競爭,也促使其他國家更加重視 AI 技術的發展。DeepSeek 的開放權重模型和低成本訓練方法,可能會對未來的 AI 發展方向產生影響,推動 AI 技術的普及化和民主化。

2025 年 YouTube SEO 如何做:來自 ADILO 的深度研究

2025 年 YouTube SEO 如何做:來自 ADILO 的深度研究

YouTube 作為全球最大的影音平台,面對超過 43 億部影片的海量資料庫,其搜尋排名機制的微妙調整與最佳化策略,一直都是業界與創作者熱議的焦點。近期隨需視訊託管平台 ADILO 一項針對 160 萬部影片的大數據研究,深入剖析了 300 部排名前三的競爭性關鍵字影片,提出具體、可操作的 YouTube SEO 技巧。這份數據報告不僅為創作者提供了現實案例,更以未來趨勢的視角,為創作者與品牌制定策略指明了方向。

YouTube SEO 的現狀與挑戰

自從影片成為資訊傳遞的重要媒介以來,YouTube 平台的內容競爭愈發激烈。研究指出,多達 19% 的頻道能夠在同一關鍵字下,同時有多支影片位居前三,這顯示出平台上的關鍵字內耗現象在網站搜尋中極為罕見,但在 YouTube 中卻意外頻繁。這種現象挑戰了傳統網站 SEO 的思維模式,迫使我們重新思考:究竟什麼樣的策略才能在眾多競爭者中脫穎而出?

數據背後的真相:關鍵統計數字揭示策略密碼

根據這項 2025 年的研究,以下是幾個不容忽視的重點:

  1. 多支影片策略:近五分之一的頻道在同一關鍵字下佔據多個排名,暗示出重複進攻關鍵字能顯著提升曝光率。
  2. 互動率的重要性:排名前三的影片平均互動率達到 2.65%,而頻道的平均互動率則高達 4.46%。這意味著除了單支影片外,整體頻道的活躍程度也對 SEO 有顯著影響。
  3. 觀看數與影片時長:頂尖影片的中位觀看次數約 30 萬次,時長則集中在 8 至 9 分鐘(536 秒左右)。這或許正驗證了「短小精悍」的創作法則。
  4. 描述與連結的策略:頂級影片的描述文字平均約 222 字,而 78% 的影片描述中包含外部連結,這在一定程度上增加了影片的信任度。
  5. 影像與字幕質量:從 68% 使用高清影片,到 94% 配備影片轉錄與閉幕字幕,高畫質與完整字幕成為排名高低的關鍵信號。
  6. 標題與搜尋意圖:令人意外的是,只有 6% 的影片標題與搜尋關鍵字完全吻合,絕大部分影片則採用與關鍵字相關或近似匹配的方式,凸顯出滿足搜尋意圖的重要性。
  7. 頻道品牌與地域優勢:63% 的頂尖影片來自品牌頻道,而 59% 的影片則來自美國頻道,顯示出品牌形象與地理定位在演算法中的優勢地位。

SEO 技巧:從策略制定到實戰落地

多支影片策略

在一般網站中,關鍵字內耗可能導致排名分散,但在 YouTube 上,頻道內多支影片齊心協力反而能提升整體能見度。這種策略不僅增加了出現於搜尋結果中的機會,更能從不同角度滿足用戶需求。就像在一場馬拉松比賽中,分批出擊往往能令你在不同賽段都保持優勢。

激活頻道與影片互動

用戶互動是 YouTube 排名的「秘密武器」。提升點讚、留言與分享,不僅能改善影片自身表現,更能助推整個頻道的活躍度。未來,隨著 AI 與大數據技術的進步,平台將更精細地評估互動數據,進而調整推薦機制。

增加觀看數:數據與內容雙管齊下

雖然研究顯示觀看數並非直接的排名指標,但它無疑能提升互動率與觀看時長,進而間接影響 SEO 表現。創作者應該從內容製作、推廣策略到用戶體驗全方位優化,確保每一支影片都能吸引並留住觀眾。

精準掌握影片時長

數據表明,8 至 9 分鐘的影片最符合用戶觀看習慣與平台偏好。這並非意味著所有影片都必須如此,而是提醒創作者在內容安排上要精簡有力,避免冗長而失焦,正如品味一杯上等咖啡,濃縮而不失風味。

優化影片描述

影片描述字數控制在 200 至 250 字之間,既能涵蓋必要資訊,又不至於讓用戶疲於閱讀。當然,適時地在描述中嵌入外部連結,不僅提升影片可信度,還能為觀眾提供更豐富的背景資料,達到雙贏效果。

精準的標題策略

滿足搜尋意圖遠比一味追求關鍵字堆砌來得重要。僅有 6% 的影片採用精準匹配,而大多數成功案例則採用相關或近似匹配策略。這提醒我們:內容應該更自然、更符合用戶的搜尋習慣,而不是刻意迎合演算法。

高清畫質與自定義縮圖

高品質的影像(無論是 HD 還是 4K)已成為排名的重要信號,而近九成的頂尖影片均採用自定義縮圖,這不僅提高了點擊率,更體現了專業製作的品牌形象。未來,隨著解析度技術的不斷提升,這一標準只會更加嚴苛。

補充影片轉錄與閉幕字幕

從 94% 的影片使用轉錄與閉幕字幕數據中,我們可以看出,文字內容不僅為聽障用戶提供便利,更是演算法捕捉關鍵字的重要依據。這一策略既能提升用戶體驗,又能在搜尋中贏得更多機會。

加入時間戳記

雖然時間戳記本身似乎並非決定性排名因素,但它無疑能改善用戶體驗,讓觀眾更快找到感興趣的內容。對於精心製作的專題影片,合理的時間標記就像地圖上的路標,指引用戶探索每一段精彩內容。

頻道品牌化與驗證

品牌頻道在演算法中擁有天然的優勢,63% 的頂尖影片來自具品牌形象的頻道。而雖然頻道驗證的比率僅為 54%,這也表明品牌信任度並非唯一決勝因素,但它依然是建立觀眾信賴的重要手段。未來,隨著品牌效應的進一步擴大,品牌化經營勢必成為內容創作的主流。

頻道描述中的外部連結

在頻道描述中加入網站、社群媒體等連結,能夠增加頻道的權威性和可信度。85% 的頂尖影片頻道均採用這一策略,這不僅能夠帶動更多跨平台流量,更能在演算法中樹立「專業」形象。

積極增長訂閱數

訂閱數是衡量頻道影響力的重要指標。雖然 4% 的頂尖影片來自訂閱數不足 1,000 的頻道,但大部分成功案例的中位訂閱數達到 52 萬,這無疑強調了「規模效應」的重要性。正如股票市場中的藍籌股,龐大的訂閱基數將成為頻道穩定輸出的重要保障。

頻道地域設定的重要性

研究發現,59% 的頂尖影片來自美國頻道,而那些未明確設定地區的頻道表現反而更佳,顯示出 YouTube 對美國市場的偏好。對於全球化的內容創作者而言,適當調整頻道的地域設定,或許能打破地域限制,獲得更廣泛的國際曝光。

耐心:長期經營的智慧

最終,研究中顯示出頂尖影片的中位年齡達到 29 個月,而頻道平均年齡則超過 9 年。這不僅反映出「老樹盤根」的現實,也提醒每位創作者:成功不可能一蹴而就。正如投資市場中常言道,時間才是最好的朋友,唯有耐心經營,方能在未來收穫累累碩果。

OpenAI 推出 GPT-4.5:對話式 AI 的躍進

OpenAI 推出 GPT-4.5

OpenAI 在2025年2月27日正式發表了最新一代大型語言模型 GPT-4.5,為 AI 領域投下了一顆震撼彈。執行長 Sam Altman 形容 GPT-4.5 是「第一個感覺起來像在與一個有思想的人交談的模型」。 此模型主打更自然流暢的對話體驗,並大幅降低了先前版本容易出現的「幻覺」(即生成不準確或誤導性資訊的現象)。  

YouTube thumbnailYouTube icon
影片來源:OpenAI

AI 智能的典範轉移

GPT-4.5 不僅僅是效能的提升,更代表著 AI 智能的典範轉移。 OpenAI 致力於打造更接近人類直覺的「軟性」智能,讓 AI 不再只是冷冰冰的機器,而是能夠理解語境、辨識語氣,並以更自然、更人性化的方式與人類互動。 GPT-4.5 正是 OpenAI 在此方向上的最新成果,它更強大的知識庫、更細膩的互動和更流暢的對話體驗,預示著 AI 應用將迎來更廣闊的可能性。  

更強大的知識庫、更細膩的互動

GPT-4.5 建立在 GPT-4o 的基礎上,透過擴展「非監督式學習」的規模,提升了模型辨識模式、連結資訊和生成創意想法的能力。 OpenAI 表示,GPT-4.5 擁有更廣泛的知識庫、更強的使用者意圖理解能力,以及更高的「情商」。 這使得 GPT-4.5 更擅長處理需要創造力、同理心和廣泛知識的任務,例如寫作輔助、個人教練、腦力激盪和細緻的溝通。 此外,GPT-4.5 也展現了更優異的代理規劃和執行能力,包括多步驟程式碼工作流程和複雜任務自動化。 ChatGPT Pro 的用戶現在可以透過模型選擇器,在 GPT-4.5 和其他 GPT 模型之間自由切換,享受更個人化的使用體驗。(筆者註:2025年3月6日 OpenAI 已全面開放至所有 Plus 用戶)

技術突破與效能提升

非監督式學習

GPT-4.5 的核心技術突破之一是「非監督式學習」的擴展。不同於傳統的「監督式學習」需要大量的標記數據,非監督式學習讓 AI 模型能夠從未經標記的數據中自行學習,發現數據中的模式和規律。透過擴展非監督式學習的規模,GPT-4.5 提升了模型的知識準確性和直覺判斷能力,使其在處理資訊和生成回應時更自然、更流暢。  

思維鏈推理

OpenAI 也在積極探索另一種 AI 技術—「思維鏈推理」。這種技術讓 AI 模型能夠像人類一樣,將複雜的問題分解成多個步驟,逐步思考並得出結論。雖然 GPT-4.5 並非採用思維鍊推理的模型,但 OpenAI 未來計劃將 GPT-4.5 整合到 GPT-5 中,GPT-5 將是一個整合多種技術的 AI 系統,包括思維鏈推理,並在免費、Plus 和 Pro 訂閱方案中提供分層存取級別。

效能提升

根據 OpenAI 的內部測試,GPT-4.5 在多項指標上都超越了 GPT-4o,包括日常查詢、專業查詢和創意智能。 值得注意的是,GPT-4.5 的「幻覺率」顯著降低,OpenAI 的研究顯示,已從 GPT-4o 的近 60% 降至 37% 左右。 這意味著使用者可以期待更準確、更可靠的回應。  

功能限制

目前,GPT-4.5 尚未支援語音模式、影片和螢幕共享等多模態功能。

結語

GPT-4.5 的推出,標誌著對話式 AI 進入了一個新的時代。 它更自然的互動方式、更強大的知識庫和更細膩的理解能力,將為各個領域帶來新的可能性。 OpenAI 致力於打造更普惠、更負責任的 AI 技術,讓 AI 真正成為人類的助手,而非取代人類的工具。

OpenAI 深度研究功能擴展至所有付費 ChatGPT 用戶

Deep research is now rolling out to all ChatGPT Plus, Team, Edu, and Enterprise users

OpenAI 於2025年2月26日宣布,其強大的深度研究功能將向所有付費 ChatGPT 用戶推出,包括 Plus、Team、Edu 和 Enterprise 方案的用戶。這項功能最初於 2 月初推出,僅限每月支付 200 美元的 Pro 方案用戶使用,它允許用戶指示 ChatGPT 針對幾乎任何主題創建深入的報告,並在幾分鐘內完成原本需要數小時才能完成的研究任務。

深度研究功能可以自主搜尋網路並分析大量資訊,最終生成一份條理清晰、結構完整的報告。 它可以瀏覽數千個不同的來源,例如新聞文章、研究論文和線上資料庫,並提取關鍵資訊,將其整理成結構化的報告,並引用其來源。

Plus 方案的用戶每月將獲得 10 個深度研究查詢的配額。Pro 方案的用戶則享有更高的額度,每月可以使用 120 個深度研究查詢,高於之前的 100 個。 OpenAI 表示,深度研究目前「計算量非常大」,因此免費用戶可能還需要一段時間才能試用這項功能。

深度研究如何運作?

深度研究由 OpenAI 早期版本的 o3 模型提供支持,該模型專為網頁瀏覽和數據分析進行了優化。 它利用 o3 先進的推理能力,可以搜索和解釋來自網絡的大量內容,包括文本、圖像、PDF 等等,然後以滿足您需求的報告形式輸出。 深度研究也經過真實世界任務的訓練,使用與 OpenAI 第一個推理模型 o1 相同的強化學習方法,使其能夠有效地執行需要瀏覽器和 Python 工具使用的任務。

深度研究不僅可以搜尋網路資訊,還可以讀取使用者提供的檔案,例如試算表和圖片,並進行分析。 這項功能適用於所有 ChatGPT 平台,包括網頁版、iOS、Android、macOS 和 Windows。

若要使用深度研究,您只需像往常一樣在 ChatGPT 聊天框中輸入您的查詢,然後選擇「深入研究」模式。 ChatGPT 會分析您的查詢,並可能會詢問您一些後續問題,以完善研究範圍。 深度研究的其中一項創新之處,在於它會在開始研究之前,先向使用者提出一些澄清問題,以確認使用者的需求和目標,確保最終產出的報告符合預期。

與傳統的聊天機器人交流不同,深度研究在後台運作,深入網路搜尋、閱讀文本、PDF、圖像等,然後綜合結果。深度研究在運行時,側邊欄會顯示模型的思考過程和它正在訪問的網站摘要,以查找相關資訊。最終的輸出以報告的形式在聊天中顯示。

深度研究的 AI 模型不像其他的大型語言模型那樣,擁有大量的內建知識。 12 相反地,深度研究更依賴於即時搜尋和分析網路上的資訊,這也讓它的產出結果更有可能保持最新的資訊,並減少「幻覺」的產生。 12

透過這些步驟,深度研究能為使用者帶來多項重要優勢:

OpenAI 深度研究的優勢

深度研究提供多項優勢,使其成為研究和分析的強大工具:

  • 深入分析: 深度研究超越了表面的網路搜尋,深入研究網路以收集關於所選主題的全面數據。 例如,如果需要編寫一份關於加密貨幣監管最新趨勢或 AI 對就業市場影響的詳細報告,深度研究可以處理繁重的工作,篩選大量線上資訊,並提供結構化、有洞察力的報告。
  • 結構化報告: 它可以提供結構良好的研究報告,節省數小時的手動編譯和格式化時間。
  • 時間效率: 可以快速訪問總結和綜合的信息,從而可以專注於分析和決策,而不是數據收集。
  • 提高效率: 深度研究可以讓使用者專注於更重要的任務,同時 AI 助手處理研究的繁重工作。
  • 競爭優勢: 通過最新的見解和研究保持信息優勢,讓使用者在自己的領域獲得競爭優勢。

功能增強

除了擴展訪問範圍外,OpenAI 還對深度研究進行了一些改進。ChatGPT 現在將在引用旁邊嵌入圖像,以提供「更豐富的見解」。 例如,如果使用者要求深度研究規劃一趟北海道的短期旅行,它不僅會提供度假村和觀光景點的概述,還會嵌入相關的圖片,讓使用者更直觀地了解這些景點。

該系統現在還可以更好地理解文件類型,這應該會帶來更好的文檔分析。例如,如果使用者上傳一份關於 AI 發展趨勢的 PDF 文件,深度研究可以更好地理解文件中的內容,並將其整合到研究報告中。

OpenAI 計劃在未來幾週內在這些報告中添加嵌入式圖像、數據可視化和其他分析輸出,以提高清晰度和背景資訊。

Anthropic 最新大型語言模型 Claude 3.7 Sonnet 功能再升級,劍指 AI 生成內容市場

Anthropic 最新大型語言模型 Claude 3.7 Sonnet 功能再升級

繼 OpenAI 的 GPT-o3 後, Anthropic 也推出最新力作 Claude 3.7 Sonnet ,號稱是目前最智能的 AI 模型,不僅擁有混合推理能力,更大幅提升程式碼撰寫和電腦使用效率,為 AI 生成內容市場投下震撼彈。  

YouTube thumbnailYouTube icon
影片來源:Anthropic

Claude 3.7 Sonnet 是什麼?

Claude 3.7 Sonnet 是 Anthropic 開發的混合推理模型,採用全新「延伸思考」功能,並改進了程式碼撰寫和電腦使用方面的能力。 與其他大型語言模型相比, Claude 3.7 Sonnet 最獨特之處在於它結合了 LLM 和推理模型的優勢。 一般的 LLM 擅長生成文字和理解語言模式,而推理模型則可以將複雜問題分解成步驟,顯示其「思考鏈」,以得出解決方案。 Claude 3.7 Sonnet 則 兼具兩者 的能力,使其在市場上獨樹一幟。 此外,Claude 3.7 Sonnet 的輸出容量也大幅提升,可產生長達 128,000 個 token 的回應,是 Claude 3.5 Sonnet 的 16 倍。 更長的回應長度對於程式碼和內容生成特別有效。  

混合推理: Claude 3.7 Sonnet 的秘密武器

Claude 3.7 Sonnet 導入了一種獨特的 AI 推理方法,將其與其他功能無縫整合。 不同於傳統模型將快速回應和需要深入思考的回應分開處理, Claude 3.7 Sonnet 允許用戶在標準和延伸思考模式之間切換。 在標準模式下,它的功能類似於 Claude 3.5 Sonnet 的升級版;而在延伸思考模式下,它會進行自我反思,以在各種任務中取得更好的結果。 用戶可以調整模型思考的時間,在速度和答案品質之間取得彈性平衡。 更重要的是, Claude 3.7 Sonnet 允許用戶設定「思考預算」,也就是調整模型思考的時間,最多可達 128,000 個 token,在速度、準確性和成本之間取得平衡。 這種彈性讓 AI 模型更能適應各種業務和技術需求。  

Claude 3.7 Sonnet 的混合推理模式與傳統大型語言模型的推理方式截然不同,它更像是人類大腦的運作方式。 傳統 LLM 通常使用不同的模型來處理快速查詢和複雜問題,而 Claude 3.7 Sonnet 則將推理能力整合到單一模型中,無論是回答簡單問題還是解決困難的謎題,都使用相同的「大腦」。  

程式碼撰寫能力大躍進

Claude 3.7 Sonnet 在軟體開發方面表現出色,尤其是在前端網頁開發方面。 它在程式碼基準測試中達到 最先進的效能 ,成為開發人員的強大工具。 此外, Anthropic 還推出了 Claude Code ,這是一款 AI 驅動的程式碼輔助工具,直接內建於模型中。 Claude Code 具備以下優勢:  

  1. 卓越的程式碼生成能力: 基準測試顯示, Claude Code 在特定程式碼任務中的表現優於先前的 Claude 模型 。
  2. 除錯和重構: 該模型協助開發人員進行程式碼除錯、程式碼優化,並以更簡單的方式解釋複雜的邏輯。
  3. 多語言支援: Claude Code 支援多種程式語言,對軟體工程師、研究人員和 AI 開發人員都非常有用。

開發人員可以透過終端機委派工程任務,例如搜尋和編輯程式碼、執行自動化測試,以及將變更提交到 GitHub 等。  

Claude 3.7 Sonnet 的進階功能

Claude 3.7 Sonnet 引入了「動作擴展」功能,這是一種改進的功能,允許模型迭代地呼叫函數、響應環境變化,並持續執行直到完成開放式任務。 其中一個例子是使用電腦: Claude 可以發出虛擬滑鼠點擊和鍵盤按鍵來代替用戶完成任務。與之前的模型相比, Claude 3.7 Sonnet 可以為電腦使用任務分配更多時間和計算能力,而且結果通常更好。  

Claude 3.7 Sonnet 與其他模型的比較

功能Claude 3.7 SonnetGPT-o3Grok 3DeepSeekGemini 2.0
混合推理能力✅✅✅✅⚠️ (僅限 Flash Thinking)
程式碼撰寫能力✅✅✅✅✅
代理工作流程✅⚠️✅⚠️✅
可見的逐步推理✅⚠️ (部分)✅✅✅ (僅限 Flash Thinking)
可調整的推理預算✅⚠️ (僅限 o3-mini)✅⚠️❌
多模態輸入⚠️ (部分)⚠️ (部分)✅✅✅
多模態輸出❌❌✅❌⚠️ (僅限 Flash)
網路搜尋❌❌✅❌✅

Claude 3.7 Sonnet 在混合推理能力方面表現出色,允許用戶在快速回應和深入思考之間切換。 它也具備強大的程式碼撰寫能力,並在 SWE-bench Verified 和 TAU-bench 等基準測試中達到最先進的效能。 此外, Claude 3.7 Sonnet 還具備代理工作流程能力,可以自主導航多步驟流程。 它可以顯示其推理過程,提高 AI 決策的透明度。 用戶還可以控制模型思考的時間,平衡速度、成本和效能。  

GPT-o3 在推理和程式碼撰寫方面也表現出色,尤其是在數學和科學領域。 它引入了「程式合成」功能,可以將現有知識重新組合成新的演算法,解決以前未曾遇到的問題。 GPT-o3 也採用了增強的「思考鏈」推理技術,模仿人類的腦力激盪過程。 然而, GPT-o3 的逐步推理過程並非完全可見, OpenAI 僅提供 CoT 的摘要版本。  

Grok 3 是一款多模態模型,具備進階的文字生成、圖像生成和推理能力。 它可以透過 Think 和 Big Brain 模式進行逐步推理,並透過 DeepSearch 模式搜尋網路資訊。 Grok 3 在多項基準測試中表現出色,包括 AIME 2025 、 Chatbot Arena 和 GPQA 。  

DeepSeek 專注於進階推理能力,並透過強化學習進行訓練。 它在數學、程式碼和科學問題解決方面表現出色。 DeepSeek 採用多頭潛在注意力 ( MLA ) 和多 token 預測 ( MTP ) 等架構創新,提高回應速度和準確性。  

Gemini 2.0 是 Google 推出的多模態模型,具備文字、圖像和語音處理能力。 Gemini 2.0 Flash 是其最新版本,支援即時 Live API 和增強的代理能力。 Gemini 2.0 Flash Thinking Experimental 則具備進階推理能力,並在 AIME2024 、 GPQA Diamond 和 MMMU 等基準測試中表現出色。  

Claude 3.7 Sonnet 的效能

Claude 3.7 Sonnet 在多項基準測試中展現出其強大的效能。 它在 SWE-bench Verified 和 TAU-bench 等基準測試中達到最先進的效能,證明了其強大的程式碼撰寫和問題解決能力。 此外,它在 AIME 2024 、 MMLU 等測試中的表現也相當出色,甚至在 Pokémon 遊戲測試中超越了所有先前的模型。 延伸思考模式讓 Claude 3.7 Sonnet 能夠更深入地分析複雜問題,進而在數學、物理和程式碼等任務中取得更好的結果。  

安全性與可靠性

Anthropic 顯著提升了 Claude 3.7 Sonnet 的安全性機制,重點包括:  

  1. 與先前版本相比,不必要的拒絕減少了 45% 。
  2. 更好地處理提示注入攻擊。
  3. 提高推理的可信度,減少幻覺和誤導性回應。

結語

Claude 3.7 Sonnet 是一款功能強大的大型語言模型,擁有混合推理、增強的程式碼撰寫能力和可調整的推理預算等多項優勢。 它在各個領域都有廣泛的應用潛力,可望成為 AI 生成內容市場的明日之星。 隨著 AI 技術的持續發展, Claude 3.7 Sonnet 將在推動 AI 應用和商業價值方面發揮重要作用。 其混合推理模式更接近人類的思考方式,讓 AI 模型不再只是單純的語言工具,而是能夠協助人類解決更複雜問題的合作夥伴。

常見問題 ( FAQ )

  1. Claude 3.7 Sonnet 在哪裡可以使用? Claude 3.7 Sonnet 目前可在所有 Claude 方案中使用,包括免費版、專業版、團隊版和企業版,以及 Anthropic API 、 Amazon Bedrock 和 Google Cloud 的 Vertex AI 。
  2. Claude 3.7 Sonnet 的價格是多少? Claude 3.7 Sonnet 的價格與其前身相同:每百萬個輸入 token 3 美元,每百萬個輸出 token (包括思考 token ) 15 美元。
  3. Claude 3.7 Sonnet 的主要競爭對手有哪些? Claude 3.7 Sonnet 的主要競爭對手包括 OpenAI 的 GPT-o3 和 Google 的 Gemini 2.0 Pro Experimental 、 Grok 3 及 DeekSeek R1 。
  4. Claude 3.7 Sonnet 有哪些潛在的應用? Claude 3.7 Sonnet 的潛在應用包括程式碼生成、進階聊天機器人、知識問答、視覺資料提取、客戶服務代理程式、內容生成和分析、機器人流程自動化等。