Midjourney 發佈 V6.1 版本,AI 圖像生成技術再創新高

Midjourney V6.1 測試 - 人像 - V6.1 結果

人工智能圖像生成領域的領先企業 Midjourney 2024年7月31日宣佈推出其備受期待的 V6.1 版本。這次更新不僅帶來了多項重大技術突破,更將成為該平台的默認模型,標誌著 AI 圖像生成技術的又一重要里程碑。
V6.1 版本的核心升級涵蓋了多個關鍵領域。首先,在圖像連貫性方面取得了顯著進展。新版本能夠更準確地生成人體四肢、植物和動物等元素,大大提升了整體圖像的自然度和真實感。其次,圖像品質得到了全面優化,包括減少像素瑕疵、增強紋理效果,特別是在皮膚質感和 8 位復古風格的呈現上有明顯改善。
更值得注意的是,V6.1 在處理圖像細節方面表現出色。眼睛、小臉部特徵以及遠處的手等細微元素都能得到更精確、更詳細的呈現。這一改進無疑將為創作者提供更多的可能性,使得生成的圖像更加細膩逼真。
在效能方面,Midjourney 也有所突破。新版本引入了全新的放大器功能,能夠顯著提升圖像和紋理質量。同時,標準圖像任務的處理速度提升了約 25%,這意味著用戶可以更快地獲得高質量的圖像輸出。
文字準確度的提升是另一個重要改進。當用戶在提示詞中使用引號標註文字時,V6.1 能夠更準確地在圖像中呈現這些文字,這對於需要在圖像中包含特定文字的創作者來說是一個重大利好。
V6.1 版本還革新了個人化功能。新的個人化模型提供了更多細微差別、驚喜元素和準確性。此外,Midjourney 引入了個人化代碼版本控制功能,允許用戶使用舊任務中的任何個人化代碼來應用該任務的個人化模型和數據。這一功能大大增強了用戶對生成結果的控制力。
除了上述主要更新,V6.1 還引入了一個名為 「–q 2」 的新模式。這個模式雖然會增加 25% 的處理時間,但能夠在某些情況下增加更多紋理細節,代價是可能略微降低圖像的整體連貫性。Midjourney 表示,這次更新後,整體圖像效果應該 「普遍更加美觀」。
然而,V6.1 版本也存在一些局限性。目前,新版本並未更新內繪/外繪模型,這意味著在使用縮放、重新構圖、重繪或區域變化等功能時,系統將回退到 V6.0 模型。對於希望繼續使用舊版本的用戶,Midjourney 提供了簡單的切換方法,用戶可以在設置中選擇 V6,或在任務後輸入 「–v 6」 指令。
Midjourney 透露可能會在下個月左右發布 V6.2 版本,帶來進一步的改進。但在此之前,公司希望盡可能收集更多用戶使用 V6.1 的數據。這也是 Midjourney 決定將 V6.1 設為所有用戶默認模型的原因之一。
值得一提的是,這次發布的功能很大程度上是基於社區用戶在 Midjourney 官方網站上提交和排序的優先事項。Midjourney 對社區成員的參與表示感謝,並鼓勵用戶在專門的頻道中展示最新的 V6.1 圖像、個人化結果,以及分享他們的想法和建議。
隨著 V6.1 版本的推出,Midjourney 再次展現了其在 AI 圖像生成領域的創新能力和領導地位。這次更新不僅提升了圖像質量和生成效率,還為創作者提供了更多個性化和精細控制的可能性。

實際測試

人物細節

Prompt: In the realm of photography, envision a picture filled with urban nostalgia. It depicts a portrait of youthful discontent placed against the backdrop of an ageless city scene. A woman reclines listlessly on an old, industrial metal staircase, and her posture emanates a feeling of self-reflection and quiet rebellion. She wears a plain black t-shirt, which is snug and slightly worn, delicately outlining her figure. Her black jeans embody the charm of streetwear fashion. Classic black and white shoes form a sharp contrast with the rusted steps, and her casual lace-up style implies a readiness to leap into action. Her hair is a flow of dark waves, partially covered by a black cap, with the brim showing a touch of youthful boldness. Around her, the worn brick walls murmur tales of the city’s bygone days, and the windows reflect fragmented views of urban existence. There is an atmosphere of contemplation as she rests her head on one arm, looking afar, perhaps lost in her thoughts or merely relishing a moment of solitude within the urban labyrinth. Canon EOS-1D X Mark III, f/5.6. –ar 16:9 –s 100(在攝影領域,想像一張充滿都市懷舊的照片。 它描繪了一幅年輕人不滿的肖像,背景是永恒的都市景象。 一個女人無精打采地躺在一個古老的工業金屬樓梯上,她的姿勢散發出一種自我反省和安靜反叛的感覺。 她穿著一件樸素的黑色T恤,舒適而略顯破舊,精緻地勾勒出她的身材。她的黑色牛仔褲體現了街頭時尚的魅力。 經典的黑白鞋和生銹的臺階形成了鮮明的對比,她隨意的繫帶風格意味著隨時準備行動。 她的頭髮呈深色波浪狀,部分被一頂黑色帽子遮住,帽沿透出一絲年輕的大膽。 在她周圍,破舊的磚牆訴說著這座城市過去的故事,窗戶反映出對都市存在的零散看法。 當她把頭靠在一隻胳膊上,望著遠方時,有一種沉思的氣氛,也許迷失在她的思緒中,或者只是在城市迷宮中享受片刻的孤獨。)

V6

Midjourney V6.1 測試 - 人像 - V6 對照

V6.1

Midjourney V6.1 測試 - 人像 - V6.1 結果

文字

Prompt: A photorealistic scene shows a modern urban building from the front view at night. There is a “PROMPTHERO” text bracket signage in neon lights on the side of the building. The ambiance is of dusk, with the building surrounded by a large crowd. Soft glows emanate from the windows, and a subtle city soundscape can be perceived. –ar 16:9 –s 100(一個逼真的場景顯示了夜晚從正面看到的現代城市建築。 大樓側面的霓虹燈上有一個“PROMPATHERO”文字括弧標誌。 氛圍是黃昏,建築被一大群人包圍著。 柔和的光芒從窗戶散發出來,可以感受到微妙的都市聲景。)

V6

Midjourney V6.1 測試 - 文字 - V6 對照

V6.1

Midjourney V6.1 測試 - 人像 - V6.1 結果

紋理

Prompt: The Pantheon of Rome and the Louvre, presented in the style of domestic interiors, reminiscent of 19th-century American paintings and works on paper, with an interdisciplinary art approach, incorporating elements of kintsugi, featuring large canvas sizes, emphasizing symmetry, and showcasing detailed naturalism. –ar 16:9 –s 100(羅馬萬神殿和盧浮宮以國內室內風格呈現,讓人聯想到19世紀的美國繪畫和紙上作品,採用跨學科的藝術方法,融合了金津的元素,具有大畫布尺寸,強調對稱性,並展示了詳細的自然主義。)

V6

Midjourney V6.1 測試 - 紋理 - V6 對照

V6.1 (增加 –q 2)

Midjourney V6.1 測試 - 紋理 - V6.1 結果

Google 專家解密國際化 SEO 與 hreflang

Google 專家解密國際化 SEO 與 hreflang

在全球化的數位時代,企業網站面臨著前所未有的挑戰:如何在不同語言和地區之間無縫切換,同時保持搜尋引擎排名?答案就在一個看似簡單卻威力強大的 HTML 屬性中— hreflang 。

然而,正如 Google 搜尋關係團隊的專家在2024年7月25日的 Podcast 中透露,hreflang 的實施遠比表面上看起來要複雜得多。讓我們深入探討這個國際化網站的秘密武器,了解它如何改變了我們構建全球網站的方式。

hreflang :不只是一個標籤

hreflang 是一個 HTML 屬性,用於告訴搜尋引擎一個網頁的語言和目標地區。聽起來很簡單,對吧?但正如 Google 的專家指出的,「當你的網站很大或你在管理多個屬性時,事情就變得複雜了。」

想像一下,你正在為一個跨國電商巨頭管理網站。每個國家可能需要不同的域名,不同的 URL 結構,甚至是完全不同的內容。突然間, hreflang 的實施變成了一個複雜的拼圖遊戲。

複雜性的根源

Google 的專家解釋說:「複雜性主要來自於多個域名、不同的 URL 結構和本地化需求。」這意味著,對於大型跨國公司來說,實施 hreflang 不僅僅是添加一些標籤那麼簡單。它需要全面的戰略規劃和精確的執行。

一位跨國科技公司 SEO 主管表示:「我們花了將近六個月的時間來正確實施 hreflang 。這不僅僅是技術問題,更是一個組織和流程的挑戰。」

綠地項目的優勢

有趣的是, Google 的專家指出,從零開始的「綠地項目」在實施 hreflang 時往往更容易。「如果你從頭開始,你可以設計一個理想的結構,」他們說。這對於初創公司來說是個好消息,但對於已經擁有複雜網站結構的老牌企業來說,卻可能是一個挑戰。

域名策略:不再那麼重要了?

在討論中,專家們提到了一個有趣的觀點:從搜尋引擎的角度來看,使用子目錄、子域名還是完全不同的頂級域名,差異並不大。這可能會讓許多長期依賴特定域名策略的企業感到驚訝。

「國家頂級域名(ccTLD)曾經提供一些優勢,」一位專家解釋道,「但隨著時間推移,其重要性可能會降低。」這一觀點可能會引發企業重新思考其域名策略。

語言 vs. 國家:Google 的平衡術

Google 採用了一種稱為「語言降級,國家提升」(LDCP)的策略來處理本地化搜尋結果。這意味著內容的語言和目標國家都會影響搜尋排名,但方式可能與你想像的不同。

一位 SEO 顧問解釋說:「這就像是一場精妙的舞蹈。你需要在語言相關性和地理相關性之間找到完美的平衡點。」

個人化:新的複雜因素

讓情況變得更加複雜的是個人化因素。用戶的搜尋歷史和語言偏好可能會極大地影響他們看到的結果。這意味著即使你完美地實施了 hreflang ,用戶仍可能看到意料之外的結果。

「這就是為什麼全面的分析和持續的優化如此重要,」一位數位行銷專家指出。「你不能只依賴技術實施, hreflang 需要持續的關注和調整。」

技術實施:細節決定成敗

在技術層面, hreflang 可以通過 HTTP 頭、HTML 標記或 XML 站點地圖來實施。雖然 Google 的專家表示位置在技術上並不重要,但他們建議在 HTML 中實施可能有助於更快的發現和驗證。

「這裡有一個微妙的權衡,」一位網站開發者解釋道。「在 HTML 中實施可能會增加頁面大小,但它可以提供更快的反饋循環。對於大型網站,這種差異可能會產生顯著影響。」

hreflang vs. lang 屬性:信任的轉變

有趣的是, Google 不再依賴 HTML 的 lang 屬性來判斷頁面語言。「這主要是由於過去的濫用,」專家解釋道。相比之下, hreflang 被認為更可靠,因為實施它需要額外的努力和投資。

這種信任的轉變突顯了在網絡世界中保持誠信的重要性。正如一位網路安全專家指出的:「在數位領域,信任一旦失去,就很難重建。這適用於安全性,也適用於 SEO 。」

x-default :被低估的英雄

在討論中,專家們還提到了 x-default 標記的重要性。這個標記用於指定默認或備用頁面,通常用於語言選擇頁面或通用內容。

「 x-default 就像是你的安全網,」一位國際化專家解釋道。「它確保即使用戶進入了一個不適合他們的頁面,他們仍然可以找到正確的內容。」

AI 和自動化的角色

隨著人工智能和機器學習技術的進步,我們可能會看到 hreflang 實施的自動化程度提高。 Google 的專家暗示,未來可能會有更智能的系統來處理語言和地區定位。

「想像一下,如果 AI 可以實時分析用戶行為和內容,並動態調整 hreflang 設置,」一位 AI 研究員興奮地說。「這將徹底改變跨語言搜尋的遊戲規則。」

結語:複雜但值得

儘管實施 hreflang 充滿挑戰,但對於希望在全球市場取得成功的企業來說,這仍然是一個關鍵工具。正如 Google 的專家所強調的,成功的關鍵在於理解複雜性,並採取全面的方法。

「 hreflang 不僅僅是一個技術問題,」一位數位策略專家總結道。「它是關於理解你的全球受眾,適應不同的市場,並提供無縫的用戶體驗。在數位世界中,這可能就是成功和失敗的區別。」

隨著網路的不斷發展,掌握像 hreflang 這樣的工具將成為每個網站開發者和數位營銷專業人士必備的技能。在這個日益全球化的數位生態系統中,那些能夠有效管理多語言和多地區內容的企業,將在競爭中脫穎而出。

最後正如 Google 的專家所說:「在數位世界中,邊界正在消失,但了解和尊重這些邊界從未如此重要。」這可能就是 hreflang 的最大教訓:在走向全球的同時,我們必須更加重視本地化。

重點摘要

  1. 國際化與 hreflang : hreflang 是一種 HTML 屬性,用於指定網頁的語言和目標地區。
  2. 實施複雜性:對於大型網站或管理多個屬性時, hreflang 的實施可能變得複雜,特別是當不同地區需要不同的域名或 URL 結構時。
  3. URL 結構:理想情況下,使用一致的 URL 結構可以簡化 hreflang 的實施,但實際情況需要針對不同地區進行調整。
  4. 錯誤來源:複雜性主要來自於多個域名、不同的 URL 結構和本地化需求,這些因素可能導致同步和維護困難。
  5. 繼承結構:從現有網站繼承的複雜 URL 結構可能會增加實施 hreflang 的難度。
  6. 綠地項目優勢:從零開始的項目更容易實施 hreflang ,因為可以從一開始就規劃合適的結構。
  7. 域名選擇:子目錄、子域名或完全不同的頂級域名都是可行的選擇,從搜尋引擎的角度來看並無太大區別。
  8. 國家頂級域名(ccTLD):雖然曾經提供一些優勢,但隨著時間推移,其重要性可能會降低。
  9. 內容與目標國家:使用特定國家域名不再可靠地表示內容針對該國家,因為域名的創意用途日益增加。
  10. 語言與國家定位: Google 使用「語言降級,國家提升」(LDCP)的策略來處理本地化搜尋結果。
  11. 混合語言內容:在同一目錄下混合不同語言的內容通常不會造成問題, Google 可以識別頁面級別的語言。
  12. 個人化因素:用戶的搜尋歷史和語言偏好可能影響搜尋結果的本地化呈現。
  13. HTML lang 屬性:由於過去濫用, Google 不再依賴 HTML 的 lang 屬性來判斷頁面語言。
  14. hreflang 的可靠性:相較於 lang 屬性, hreflang 被認為更可靠,因為實施它需要額外的努力和投資。
  15. hreflang 的普及率:根據 Web Almanac 的數據,約9%的網站首頁使用了 hreflang 標記。
  16. hreflang 的實施方式:可以通過 HTTP 頭、HTML標記或 XML 站點地圖來實施 hreflang 。
  17. 實施位置的影響:雖然技術上位置不重要,但在 HTML 中實施可能有助於更快的發現和驗證。
  18. 自引用問題:文檔建議在 hreflang 集合中包含對當前頁面的引用,可能與規範化(canonical)相關。
  19. 重複內容處理: hreflang 有助於處理不同語言版本間的細微差異,避免被視為重複內容。
  20. x-default 用途:用於指定默認或備用頁面,通常用於語言選擇頁面或通用內容。

Google 推出 Gemini 1.5 Flash:AI 助手迎來重大升級,免費版用戶受惠

Google 推出 Gemini 1.5 Flash:AI 助手迎來重大升級,免費版用戶受惠

在人工智能競賽日益激烈的當下,Google 再次展現其技術實力,為旗下 AI 助手 Gemini 推出重大升級。2024年7月25日,Google 正式宣布將 Gemini 1.5 Flash 模型引入免費版 Gemini,為用戶帶來更快、更智能的體驗。這一舉措不僅提升了 Google 在 AI 領域的競爭力,也為普通用戶提供了更強大的 AI 工具。

Gemini 1.5 Flash:速度與智能的完美結合

Gemini 副總裁 Amar Subramanya 表示:「Gemini 1.5 Flash 在質量和延遲方面都有全面改進,尤其在推理和圖像理解方面的進步更為顯著。」這款新模型被描述為 Google 最快且最具成本效益的多模態 AI 模型,專為需要低延遲和高頻率任務而設計。

與此前的版本相比,Gemini 1.5 Flash 在以下幾個方面有了顯著提升:

  1. 擴大的脈絡窗口:從原來的 8K 提升到 32K tokens,使 AI 能夠處理更長的對話和更複雜的問題。這意味著用戶可以進行更深入的討論,而 AI 助手能夠保持更長的記憶力。
  2. 多模態能力:支持文本、圖像、音頻和視頻的輸入和輸出,使其能夠處理更複雜的任務,如圖像和視頻字幕生成、數據提取等。
  3. 文件上傳功能:即將推出的功能將允許用戶通過 Google Drive 或直接從設備上傳文件。這使得用戶可以要求 Gemini 根據上傳的學習指南生成練習題,或分析數據文件。
  4. 相關內容鏈接:為了提高回答的準確性和可信度,Gemini 現在會在回應中提供引用連結,幫助用戶驗證資訊的來源。

全球化擴張與語言支持

Google 此次升級不僅提升了 Gemini 的性能,還大幅擴展了其服務範圍。Gemini 1.5 Flash 現已在超過 230 個國家和地區推出,支持 40 種語言。這一舉措顯示了 Google 在全球 AI 市場的野心,也為不同語言背景的用戶提供了更便利的 AI 助手服務。

Google Messages 整合與移動應用擴展

隨著此次更新,Google 還宣布將 Gemini 整合到 Google Messages 中,並擴大了其在歐洲經濟區、英國和瑞士的可用性。同時,Gemini 移動應用程序也將在更多國家推出,使用戶能夠隨時隨地獲得 AI 助手的幫助。

青少年版 Gemini:安全與教育並重

值得注意的是,Google 還特別關注了青少年群體的需求。Gemini 的青少年版本現已在全球推廣,支持 40 種語言。Google 與兒童安全和發展組織合作,制定了新的政策和保護措施,以確保 13 歲及以上的青少年能夠安全地使用 Gemini 作為研究工具。

AI 幻覺問題的應對

為了解決 AI 生成內容可能出現的「幻覺」問題(即 AI 產生的錯誤或無意義的回應),Google 採取了多項措施。除了前面提到的相關內容鏈接外,Gemini 還引入了「雙重檢查」功能。這項功能利用 Google 搜索來驗證回應,突出顯示得到證實或被反駁的陳述,從而減少錯誤信息的傳播。

市場影響與行業反應

Gemini 1.5 Flash 的推出無疑將對 AI 助手市場產生重大影響。分析師普遍認為,這一升級將加劇 Google 與 OpenAI、Microsoft 等競爭對手之間的競爭。

科技行業分析師 Sarah Chen 表示:「Google 此次將高級功能引入免費版 Gemini,顯示了公司在 AI 普及化方面的決心。這不僅會吸引更多用戶嘗試 Gemini,也可能迫使競爭對手重新考慮其定價策略。」

然而,也有專家指出,儘管 Gemini 1.5 Flash 在多個方面有所改進,但在某些特定任務上,如編碼輔助等,仍可能落後於某些專門化的 AI 工具。

持續改進 Gemini 功能

Google 表示,這只是 Gemini 發展的開始。公司計劃在未來幾個月內持續改進 Gemini 的功能,包括進一步提高其理解和生成能力,以及探索更多的應用場景。

AI 研究專家 Dr. Michael Lee 認為:「Gemini 1.5 Flash 的推出標誌著通用 AI 助手向更專業、更高效方向發展的重要一步。我們可以預期,未來的 AI 助手將更加個性化,能夠更好地理解用戶的具體需求和工作流程。」

結語

Gemini 1.5 Flash 的推出不僅展示了 Google 在 AI 技術上的進步,也反映了科技巨頭們在 AI 普及化方面的激烈競爭。隨著這些強大的 AI 工具變得越來越容易獲取,可以期待看到更多創新的應用場景和使用方式。然而,如何在推動 AI 發展的同時保護用戶隱私、確保資訊準確性,仍然是整個行業需要持續關注和解決的問題。

Mistral AI 推出最新大型語言模型 Mistral Large 2,挑戰 Llama 3.1

Mistral AI 推出最新大型語言模型 Mistral Large 2,挑戰 Llama 3.1

在人工智能技術迅猛發展的時代,Mistral AI 再次引領潮流,在2024年7月24日推出了其最新的旗艦大型語言模型— Mistral Large 2。這款模型擁有 1230 億個參數,並在多個方面展現了顯著的性能提升,包括代碼生成、數學和推理能力。這一發布無疑為人工智能領域帶來了新的突破和挑戰。

Mistral Large 2 的主要特點

強大的多語言支持

Mistral Large 2 支持多達 11 種語言,包括法語、德語、西班牙語、意大利語、葡萄牙語、阿拉伯語、印地語、俄語、中文、日語和韓語。這使得該模型在全球範圍內具有廣泛的應用潛力。

優秀的編碼能力

該模型支持超過 80 種編程語言,包括 Python、Java、C、C++、JavaScript 和 Bash。這使得它在代碼生成和編程輔助方面具有強大的競爭力。

高效的上下文窗口

Mistral Large 2 擁有 128,000 個 token 的上下文窗口,比其前代產品大大增加,這意味著它可以處理更長的文本和更複雜的任務。

開放權重

Mistral Large 2 的權重已經開放,但僅限於研究和非商業用途。商業用途需要獲得專門的許可。

高性能基準測試

在多個基準測試中,Mistral Large 2 的性能表現優異。在 Wild Bench、Arena Hard 和 MT Bench 基準測試中,它的表現優於 Llama 3.1 405B 和 Claude 3 Opus。在 MMLU 基準測試中,該模型的表現優於 Llama 3.1 70B,與 Llama 3.1 405B 相當。

改進的函數調用和檢索技能

Mistral Large 2 現在支持並行和順序函數調用,使開發人員能夠構建更複雜的商業人工智能應用。

開源和合作

Mistral AI 強調開源,並與微軟和 Google 建立了合作關係,將其模型在 Azure 和 Google 雲上提供。

市場反應與合作

在 Mistral Large 2 推出後,市場反應熱烈。Google Cloud 宣布將支持 Mistral AI 的新模型,包括 Codestral、Nemo 和 Large 2,並將其整合到 Vertex AI 平台上。這一合作將使全球開發者能夠更輕鬆地使用這些先進的人工智能技術,從而加速創新和應用開發。

微軟也宣佈將 Mistral Large 2 和 Mistral Nemo 引入 Azure AI 平台,提供無伺服器部署和按需付費選項。這意味著企業和開發者可以更靈活地使用這些模型來構建和部署高效的人工智能應用。

性能與價格

根據最新的性能基準測試,Mistral Large 2 在多個指標上表現出色。其 MMLU 分數達到 0.84,質量指數為 91,顯示出其在推理和知識方面的強大能力。然而,該模型的價格相對較高,每百萬個 token 的價格為 4.50 美元,輸出速度為每秒 43.5 個 token,延遲時間為 0.29 秒。

後續發展

Mistral AI 的聯合創始人兼首席執行官 Arthur Mensch 表示:「我們的目標是將最先進的人工智能技術帶到每個人的手中。與 Google Cloud 和微軟的合作標誌著我們在實現這一目標方面邁出了重要的一步。」這些合作不僅有助於推動人工智能技術的普及,還將促進更多創新應用的誕生。

隨著 Mistral Large 2 的推出,Mistral AI 無疑在人工智能領域樹立了新的標杆。這款模型不僅在多語言支持和編碼能力方面表現卓越,還在多項基準測試中展示了其強大的性能。隨著 Mistral AI 與微軟和 Google 的合作,這款模型未來有望在更多應用場景中發揮重要作用。

Meta 推出突破性 AI 模型 Llama 3.1,挑戰 OpenAI 與 Google 霸主地位

Meta 推出突破性 AI 模型 Llama 3.1,挑戰 OpenAI 與 Google 霸主地位

在人工智能(AI)競賽日益激烈的當下,Meta 於2024年7月24日正式發布了其最新開源 AI 模型 Llama 3.1,這一舉動被視為該公司在 AI 領域的重大突破,同時也向 OpenAI 和 Google 等競爭對手發起了直接挑戰。

Meta 執行長馬克·祖克柏(Mark Zuckerberg)在發布會上表示, Llama 3.1 是「最先進」的大型語言模型,擁有廣泛的新功能,包括改善推理能力以處理複雜的數學問題,以及即時將文本整合成一本完整的書籍。祖克柏稱這款模型為「藝術的起點」,並強調其將與 OpenAI 和 Google 的頂級模型一較高下。

模型規格與訓練細節

Llama 3.1 共推出三個版本,其中最大的版本 Llama 3.1 405B 擁有高達4050億個參數,這使其成為目前最大的開源模型之一。值得注意的是,這款模型的訓練過程使用了驚人的1.6萬顆 NVIDIA H100 晶片,充分展現了 Meta 在 AI 研發上的巨額投入。

祖克柏透露, Llama 3模型的訓練成本已達「數億美元」,而未來的模型可能需要耗資數十億美元來提升運算能力。儘管去年 Meta 進行了大規模裁員以縮減成本,但祖克柏表示公司仍願意在 AI 軍備競賽中投入大量資金,以確保在未來10到15年內在關鍵技術領域保持競爭優勢。

開源策略與生態系統建設

與 OpenAI 和 Google 等競爭對手採用封閉模型不同, Meta 選擇了開源路線。祖克柏強調,開源模型與封閉模型之間的差距正在縮小,他預測從明年開始, Llama 模型將成為業界最先進的模型。

Meta 表示, Llama 系列模型已被個人和企業下載超過3億次。為了擴大 Llama 3.1的影響力, Meta 還與多家科技巨頭展開合作。其中, NVIDIA 的 AI Foundry 將為全球企業提供 Llama 3.1模型的客製化服務。此外, Meta 還與亞馬遜(Amazon)和 Databricks 等公司合作,幫助開發者微調和訓練其模型。

業界反響與安全考量

AI 界領袖吳恩達(Andrew Ng)在社群媒體上表示, Meta 對開源模型做出了巨大貢獻,新模型是一份「美好禮物」。然而,開源模型也引發了一些安全方面的擔憂,如技術可能被競爭對手或犯罪組織濫用。對此,祖克柏強調,開源模型相較封閉模型更容易讓監管機構進行審查,從而增加透明度和安全性。

Meta 與 NVIDIA 的深度合作

值得關注的是, Meta 與 NVIDIA 的合作關係日益密切。除了使用大量 NVIDIA H100晶片訓練 Llama 3.1外, NVIDIA 執行長黃仁勳(Jensen Huang)與祖克柏還將於下週在 SIGGRAPH 2024電腦繪圖大會上首次進行公開對談。這次對談預計將聚焦於兩家公司在 AI 技術領域的合作發展。

Llama 3.1將被應用於 Meta 旗下應用程式

Llama 3.1不僅是 Meta AI 聊天機器人的核心,還被應用於 Instagram 和 WhatsApp 等旗下應用程式中。祖克柏表示, Meta 的聊天機器人已擁有「數億」用戶,並預計到今年年底將成為全球使用最廣泛的聊天機器人。

此外,祖克柏還預期 Meta 以外的其他公司也會使用 Llama 來訓練自己的 AI 模型。他將 Llama 比喻為一位「老師」,使得不同組織能夠創建自己的模型,而不必依賴其他公司銷售的現成產品。

結語

Llama 3.1的發布標誌著 Meta 在 AI 領域的重大進展,也反映了該公司在開源 AI 發展上的堅定決心。隨著 AI 技術的快速發展和應用範圍的不斷擴大, Meta 、 OpenAI 、 Google 等科技巨頭之間的競爭將更加激烈。 Llama 3.1的表現如何,是否能夠實現祖克柏所說的「成為業界最先進的模型」,將在未來幾個月內得到驗證。