下週盛大開幕:OpenAI GPT 商店引領科技創新

OpenAI 即將於下週推出其期待已久的 GPT 商店,這個新平台將允許開發者展示和分享他們自己的 GPT 應用。這一舉措被視為對人工智能領域的一大推進,OpenAI 透過一封致 GPT 開發者的信件宣布了這一消息。

OpenAI 寫給 GPT 開發者的信件內容

信件指出,對於有意於商店中分享其 GPT 應用的開發者,需要遵循一系列的步驟以確保他們的產品符合規範。這包括審核更新後的使用政策和 GPT 品牌指南,以及確認其建造者個人檔案的真實性。

GPT 商店的推出,意味著開發者將有一個官方的平台來展示他們的創新工具,這不僅能促進應用的多樣性,也為使用者提供了一個可信賴的來源去尋找和使用不同的 GPT 應用。此外,此舉也被看作是 OpenAI 推動其開放和協作生態系統戰略的一部分。

這封信還提醒開發者,他們必須將他們的 GPT 設定為「公開」狀態,以確保其在商店中顯示。這意味著那些只選擇「任何持有連結者」可見的應用將無法在商店中展出。

OpenAI 透過此舉展現出其對於創新和合作的承諾,也對所有投入時間建造 GPT 的開發者表示感謝。隨著 GPT 商店的即將上線,業界對於將出現的新應用和可能性充滿期待。

2023年12月中文大模型排行,GPT-4 Turbo 領先依舊,中國大模型急起直追

隨著人工智能領域的迅猛發展,2023年無疑成為了大模型技術競賽的關鍵一年。全球範圍內,從 OpenAI 的 GPT-4 Turbo 到各類中國本土的創新模型,一場圍繞語言理解、生成能力以及實際應用的角逐正式展開。GPT-4 Turbo 以其卓越的性能和廣泛的應用領域繼續領跑,而中國大模型則以驚人的速度追趕,展現出強大的發展潛力和國際競爭力。

這場競爭不僅是算法和技術的較量,更是對未來人工智能走向的一次深刻探索。它關乎語言模型如何更深刻地理解和生成人類語言,如何在不同的文化和語言背景下提供定制化的服務,以及如何在保護隱私和安全的前提下促進技術的健康發展。在這樣的背景下,探討 GPT-4 Turbo 的領先地位以及中國大模型的追趕之路,不僅對於業界專業人士,對於每一個關注未來技術趨勢的人都具有重要的意義。

2023年12月中文大模型排行概覽

SuperCLUE 十大基礎能力排行榜 (2023年12月) 資料來源: SuperCLUE

自 OpenAI 發布 GPT-4 Turbo 以來,這款大模型以其卓越的性能定義了全球語言模型的新標準。在眾多領域中,無論是自然語言處理、創意文本生成還是複雜問題解決,GPT-4 Turbo 都展現出了令人矚目的能力。這種持續的領先地位不僅源於其強大的算法設計,更來自於持續的數據優化和深度學習技術的進步。

SuperCLUE 大模型基準得分排行榜 (2023年12月) 資料來源: SuperCLUE

首先,GPT-4 Turbo 在理解和生成語言方面的能力遠超前代模型。它可以更準確地理解複雜的語境,提供更加連貫和有深度的回答。這一點在多輪對話、文學創作以及技術文檔撰寫等方面尤為明顯。這不僅提升了用戶體驗,也為各行各業提供了更強大的語言支持。

其次,GPT-4 Turbo 在多語言支持方面也有顯著進步。雖然它是以英語為主的模型,但對其他語言,包括中文的支持也日益完善。這使得它在全球範圍內得到了廣泛的應用,從而進一步鞏固了其領導地位。

此外,GPT-4 Turbo 的應用場景非常廣泛。從企業的客戶服務自動化到個人的創意輔助,從學術研究到內容創作,GPT-4 Turbo 正在推動著各行各業的革命。它的出現不僅是技術進步的象徵,更是未來智能應用的開端。

GPT-4 Turbo 的領先地位並非無懈可擊。隨著更多的競爭者進入市場,特別是中國的大模型迅速崛起,GPT-4 Turbo 面臨著前所未有的挑戰。如何持續創新和進步,如何在保護隱私和安全的同時擴大應用範圍,將是它未來發展的關鍵。

中國大模型的急速追趕

2023年,中國在大模型領域的急速追趕成為全球關注的焦點。從 12月 SuperCLUE 模型象限的分析中,我們可以看到,中國的頂尖模型不僅在數量上有了顯著增加,而且在質量上也達到了國際先進水準。特別是文心一言 4.0 和通義千問 2.0 這樣的模型,它們在理解語境、文本生成以及實際應用方面的表現讓世界矚目。

SuperCLUE 大模型象限 (2023年12月) 資料來源: SuperCLUE

文心一言 4.0 由百度推出,以其深度學習和大數據處理能力,在中文語境理解和文本生成方面達到了新的高度。它在多輪對話、文學創作等多個領域表現優異,展現出與 GPT-4 Turbo 相媲美的潛力。通義千問 2.0 則是阿里巴巴的力作,它在商業應用和用戶互動方面表現出色,特別是在客戶服務和市場分析等領域,展現了巨大的商業價值。

這些成就的背後,是中國在大模型技術研發和資源投入上的大幅提升。中國擁有龐大的語言數據庫和人才儲備,這為大模型的訓練和優化提供了有利條件。此外,政府的支持和行業的需求也為中國大模型的發展提供了強大動力。

然而,中國大模型的快速進步並非一帆風順。與 GPT-4 Turbo 這樣的國際領先模型相比,中國大模型在多語言支持、安全性保障以及開放應用等方面仍有差距。此外,如何在保障數據隱私和符合道德標準的同時,推動技術創新和應用擴展,也是中國大模型發展中需要面對的重要問題。

儘管如此,中國大模型的迅猛發展勢頭不容小覷。隨著技術進步和市場需求的不斷擴大,中國有望在不久的將來,在全球大模型領域中佔據更加重要的位置。

中國大模型競爭格局

隨著中國在大模型領域的急速發展,一個多元化且競爭激烈的市場格局已經形成。這一格局不僅體現在大廠和創業公司之間的競爭,也體現在各家對技術創新和市場應用的不懈追求上。

在大廠方面,像百度、阿里巴巴、騰訊等公司憑借強大的資源和技術實力,推出了如文心一言 4.0、通義千問 2.0 等領先的大模型產品。這些模型不僅在技術上與國際水平接軌,更在中文語境下進行了深度優化和應用創新,使其在中國市場具有獨特的競爭優勢。

與此同時,眾多創業公司也在這一領域崛起,它們以靈活的創新機制和針對性的解決方案,迅速佔據了市場的一席之地。這些公司往往專注於特定的細分市場或技術創新,如語音識別、情感分析或特定行業的應用,並通過與大廠的合作或獨立發展,逐漸成長為行業的重要力量。

競爭格局的形成並不意味著發展的平穩。中國大模型企業在追趕國際水平的同時,面臨著技術創新、產品質量、安全和隱私保護等多方面的挑戰。如何在這樣的競爭環境中保持持續的技術創新和產品優化,是每一家公司都需要思考的問題。

最後,隨著大模型技術在更多領域的應用,各企業也需要考慮如何在保護用戶隱私和安全的前提下,合理利用數據資源,並在激烈的市場競爭中保持自身的道德和社會責任。

Midjourney V6 最佳化實踐:跟著步驟一步一步完成所想即所見的圖像

Midjourney v6 相較於 v5.2 版本,它在影像生成品質、畫面質感和細節刻畫方面有顯著提升,光影處理也更加真實自然。 v6 和 v5.2 存在一些明顯的差異,在使用上也要特別注意。

主要差異

  1. 影像生成品質:v6 的影像產生品質相比 v5.2 更高,在畫面質感和細節刻畫上有更精緻的表現,光影處理也更真實自然。
  2. 文本提示詞理解:v6 模型對文本提示詞的理解能力更強,可以理解更長的文本提示,提示詞容量達到了350-500 個字,而 v5.2 中超過三十個字後,提示詞就不起作用。

注意事項

  1. v6 模型對提示詞非常敏感,不要在提示詞中使用「安慰劑」詞語,例如「獲獎、逼真、4k、8k、HDR」等,它們可能會干擾畫面內容的生成。
  2. 要產生更真實自然、更偏向寫實攝影的影像時,可以使用 –style raw 參數;如果想產生藝術感和美學性更強的影像,可以調高 –stylize 的數值。
  3. v6 模型對提示詞的理解變得更準確,但這也讓它顯得有些“呆板”,對於沒有提到的內容,v6 都不會呈現,不再像 v5.2 模型那樣會自由發揮。如果畫面中沒有出現想要的內容,應檢查是否遺漏了關鍵詞,或調整重點詞語的位置。盡可能使用詳細的自然語言作為提示詞描述,而非簡單的單字。

最佳化實踐

基本公式

主要畫面 + 細節描述 + 地點與光線 + 鏡頭畫面 + 風格與媒介

主要畫面

讓我們從一個基本的畫面描述開始帶著各位讀者一步一步地完成最終的圖像。

Prompt: A young Japanese female pop singer is singing. ––ar 16:9 ––style raw ––v 6.0 一個年輕的日本女性流行音樂歌手正在演唱

由於我們想做出一個模擬真實照片的圖像,所以我們先使用 ––style raw 參數產生偏向寫實攝影的影像。

細節描述

接著,增加我們想要的細部畫面。

Prompt: A young Japanese female pop singer is singing, with silver metal accessories on her hands and a microphone in her right hand. ––ar 16:9 ––style raw ––v 6.0 一個年輕的日本女性流行音樂歌手正在演唱,雙手帶著銀色的金屬配飾,右手握著麥克風。

地點與光線

接著,從主題、細節向外延伸,補充地點與光線參數。

Prompt: A young Japanese female pop singer is singing, with silver metal accessories on her hands and a microphone in her right hand. She is in the Hong Kong Coliseum, on a huge stage, looking up at the audience. Volumetric lighting, neon light. ––ar 16:9 ––style raw ––v 6.0 一個年輕的日本女性流行音樂歌手正在演唱,雙手帶著銀色的金屬配飾,右手握著麥克風。她在香港體育館內,寬廣的舞台,仰頭望著觀眾。體積照明,霓虹光。

增加光線參數之後,歌手的臉部變得更清晰明亮。但是由於 V6 將焦點放在主要敘述的歌手與配飾的呈現,香港體育館與舞台似乎就成為一個被省略掉的參數,因此我們再接下來的步驟中再強化它。

鏡頭畫面

接著,我們加入鏡頭畫面控制整體構圖的呈現。

Prompt: A young Japanese female pop singer is singing, with silver metal accessories on her hands and a microphone in her right hand. She is in the Hong Kong Coliseum, on a huge stage, looking up at the audience. Volumetric lighting, neon light. Showing the interior of the stadium and the many cheering spectators behind it. ––ar 16:9 ––style raw ––v 6.0 一個年輕的日本女性流行音樂歌手正在演唱,雙手帶著銀色的金屬配飾,右手握著麥克風。她在香港體育館內,寬廣的舞台,仰頭望著觀眾。體積照明,霓虹光。背後呈現體育館內部與眾多歡呼的觀眾。

風格與媒介

最後,補充圖像風格與媒介,若想創作非寫實照片的圖像,則需要先移除 ––style raw 參數。若是照片風格,則建議加入風格化參數強化畫面的視覺感。以筆者個人的經驗,將 stylize 值調整到 200 左右,根據跑出來的圖像找到適合的畫面再做 Variations (Strong) 可以抓到不錯的結果。或者多跑幾次,從產出的圖像再去找喜歡的構圖及感覺,這就看個人習慣而定。

鉛筆畫

Prompt: A young Japanese female pop singer is singing, with silver metal accessories on her hands and a microphone in her right hand. She is in the Hong Kong Coliseum, on a huge stage, looking up at the audience. Volumetric lighting, neon light. Showing the interior of the stadium and the many cheering spectators behind it. Pencil drawing. ––ar 16:9 ––v 6.0 一個年輕的日本女性流行音樂歌手正在演唱,雙手帶著銀色的金屬配飾,右手握著麥克風。她在香港體育館內,寬廣的舞台,仰頭望著觀眾。體積照明,霓虹光。背後呈現體育館內部與眾多歡呼的觀眾。鉛筆畫。

寶麗來相機

A young Japanese female pop singer is singing, with silver metal accessories on her hands and a microphone in her right hand. She is in the Hong Kong Coliseum, on a huge stage, looking up at the audience. Volumetric lighting, neon light. Showing the interior of the stadium and the many cheering spectators behind it. Polaroid camera. ––ar 16:9 ––style raw ––v 6.0 一個年輕的日本女性流行音樂歌手正在演唱,雙手帶著銀色的金屬配飾,右手握著麥克風。她在香港體育館內,寬廣的舞台,仰頭望著觀眾。體積照明,霓虹光。背後呈現體育館內部與眾多歡呼的觀眾。寶麗來相機。

電影畫面

A young Japanese female pop singer is singing, with silver metal accessories on her hands and a microphone in her right hand. She is in the Hong Kong Coliseum, on a huge stage, looking up at the audience. Volumetric lighting, neon light. Showing the interior of the stadium and the many cheering spectators behind it. Cinematic shot, f/16, 85mm, ISO 1600, Sony FX3. ––ar 16:9 ––style raw ––s 200 ––v 6.0 一個年輕的日本女性流行音樂歌手正在演唱,雙手帶著銀色的金屬配飾,右手握著麥克風。她在香港體育館內,寬廣的舞台,仰頭望著觀眾。體積照明,霓虹光。背後呈現體育館內部與眾多歡呼的觀眾。電影畫面。

總結來說,Midjourney v6 在圖像質量和文本提示詞理解上都有顯著提升,但也因為它對提示詞更敏感,使用時需要更精確地描述想要的結果。由於 v6 目前仍處於 alpha 測試階段,未來可能還會有重大變化,因此使用者仍然需要不斷摸索和適應新模型的特性。

進一步閱讀
  1. Midjourney V6 新手救星:MJ V6 Prompt Creator GPT

Pika 1.0 試用開放:免費體驗 AI 影片創作

Pika1.0 於2023年12月28日宣布,所有人現在都可以免費試用他們的網頁版。這是個文到影片的人工智能平台,讓用戶能從簡單的文本提示生成和編輯各種風格的影片,包括 3D 動畫、動漫或電影風格。這項科技的進步吸引了廣泛的注意,特別是在創意產業中。

Pika1.0 的特色在於它的快速影片生成功能,只需幾秒鐘就能創造出獨特的視覺內容。它特別擅長動漫風格的動物生成,所以喜歡這類風格的用戶將會非常享受使用這個平台。此外, Pika1.0還提供了背景修改等功能,讓使用者可以更自由地創造和個性化他們的影片。

在此之前,只有少數人能夠在內測階段體驗 Pika1.0,很多人只能羨慕地看著其他用戶分享他們的創作。現在,每個人都有機會免費試玩,這對於那些對此平台感興趣的用戶來說,無疑是個好消息。

這個平台尤其適合需要快速製作推廣影片的個人和中小企業,以及那些有創意想法但缺乏製作能力的創作者。 Pika 開啟了前所未有的創意可能性,允許用戶探索各種風格和類型,嘗試不同的內容類型,並將他們獨特的願景變為現實。

作為一款基於人工智能技術的應用, Pika 1.0通過強大的算法和智能分析能力,幫助用戶輕鬆、快速地創建個性化、有趣的短影片內容。這些功能使得 Pika 成為了一款強大而易於使用的影片創作工具,幫助用戶快速、高效地製作出高質量的影片內容。

實際測試

動漫

Pika 較為擅長動漫類型的影片,簡單的提示就可以有不錯的效果。

Prompt: Fast running Japanese girl, Hayao Miyazaki, Sky City, anime style.

動物

Prompt: The fast running lion in the African savannah, movie footage, lion king.

人物( photo-to-video )

Pika 提供了以照片製作影片的功能,筆者以 Leonardo.AI 創作的照片來做實際測試,對比 Leonardo 最近推出的 Motion 影片功能,大家可以比較一下效果差異。

原圖

Prompt: Blackpink Lisa’s face, Scarlett Johansson’s figure, playing Mikaela Thompson in the Transformers. Cinematic shot, full body shot, low angle view, a grand and magnificent scene. f/16, 100mm, ISO 800, Sony FX3.

Pika

Prompt: Transformers, the heartfelt smile of the female lead, movie style.

Prompt: Transformers, female protagonist crying sadly, wiping tears, movie style, 8K, high graphics quality。(筆者註:Pika 似乎對於哭的表情不太擅長 )

Leonardo Motion

Leonardo 是在靜態圖的基礎上創作1-10個動作的短影片,無法像 Pika 一樣針對人物的動作、畫面、表情等等做微調,但以影片成像品質來說較 Pika 放大後(第1個示範影片) 表現更好。不過,Leonardo 畢竟原本的強項就是 AI 圖像,對於圖像畫質及細節能夠掌握得更好那也是很合理的,希望 Pika 在這塊能夠迎頭趕上,造福更多 AI 影片創作玩家。

人物( Video-to-Video )

我們用 Leonardo Motion 製作的影片再丟進 Pika 當中,使用 Video-to-Video 的功能,並多次增加秒數到11秒,Pika 開始產生了一些意想不到的創意,各位讀者也可以嘗試看看。

Prompt: The movie scene, highly attractive and young blonde women, gazing around.

Pika 體驗網址

進一步閱讀
  1. Pika 推出 2.1 版本,大幅提昇真實感與創意
  2. Pika 1.5 推出:AI 視頻生成的新里程碑
  3. Pika 推出 Sound Effects 功能:讓影片呈現如同電影般的聽覺效果

Google Cloud 免費生成式 AI 培訓:為2024年做好準備

隨著2024年的臨近, Google Cloud 宣布將在12月份提供12天的無成本生成式 AI 培訓,以應對這一年來生成式 AI 成為熱門話題的趨勢。這項培訓旨在幫助個人提升他們的技能和知識,並為新的一年及以後的 AI 應用做好準備。

YouTube thumbnailYouTube icon
影片來源: Google

Google Cloud 的學習內容全球負責人 Jaime Farinos 和 Google Cloud 認證與證書的全球負責人 Magda Jary 邀請大家參加這一系列的培訓,這些培訓包括點播課程、實驗室和影片,旨在幫助參與者驗證他們的 AI 知識。這些生成式 AI 培訓無需任何成本,參與者可以在12月份的任何時候完成。

培訓內容從基礎開始,適合任何角色或技能水平。參與者將了解生成式 AI 的基本概念,以及如何使用 Google Cloud 工具開發自己的生成式 AI 應用。其中包括一門22分鐘的入門課程,內容涵蓋視頻、閱讀材料和測驗,以及一門關於大型語言模型( LLMs )的課程,這將幫助參與者建立對 LLMs 的基礎理解,包括使用案例和如何使用提示調整來提高 LLM 的性能。此外,參與者還有機會通過完成三門基礎課程和測驗來獲得一個可分享的 Google Cloud 技能徽章,證明他們對生成式 AI 基本概念的理解。Google Cloud 還提供了一個名為” The Arcade “的遊戲化體驗,參與者可以在 Google Cloud 環境中完成生成式 AI 實驗室,並且有機會累積積分以獲得 Google Cloud 商品。

這次的培訓是一個絕佳的機會,讓對生成式 AI 感興趣的人士無成本地提升他們的技能,並為未來的 AI 挑戰做好準備。隨著生成式 AI 技術的快速發展,這樣的培訓對於希望保持競爭力的專業人士來說是非常有價值的。

課程網址