OpenAI 推出 Sora 文字轉視頻模型:可以製作長達60秒的高品質視頻

2024年2月16日,OpenAI 再次引領科技潮流,推出了名為 Sora 的文字轉視頻模型。這項創新技術不僅能夠將文字指令轉化為高達一分鐘的視頻,而且在視覺品質和對用戶提示的遵從性方面都保持了高水準。

影片來源: OpenAI X

影片來源:Garrett Scott X

Sora 的推出,標誌著人工智能對現實世界的理解和模擬能力邁出了重要的一步。這不僅是實現通用人工智能(AGI)的重要里程碑,也為解決需要真實世界互動的問題提供了新的可能性。Sora 能夠生成包含多個角色、特定類型動作和背景細節的複雜場景,這對於視覺藝術家、設計師和電影製作人來說,無疑是一項革命性的工具。

目前,Sora 已向「紅隊」成員開放,以評估模型可能帶來的危害或風險。OpenAI 也向一些視覺藝術家、設計師和電影製作人提供了訪問權限,以獲得如何使模型對創意專業人士更有幫助的反饋。OpenAI 早期分享研究進展,目的是開始與外界合作並獲得反饋,同時讓公眾對即將到來的人工智能能力有所了解。

Sora 的視頻生成能力不僅限於特定風格(如照片寫實、動畫、黑白等),還能在保持合理連貫性的同時,生成長達一分鐘的視頻。這些視頻在物理上的動作方向上不會總是顯得不合理,這是其他文字轉視頻技術所無法比擬的。

然而,Sora 並非完美無缺。它可能在模擬複雜場景的物理特性時遇到困難,並且可能無法理解特定的因果關係。例如,人物可能咬了一口餅乾,但之後餅乾可能不會出現咬痕。模型也可能混淆提示中的空間細節,例如左右混淆,並且可能在隨時間發生的事件的精確描述上遇到困難,比如遵循特定的攝影機軌跡。

OpenAI 明確表示,Sora 目前仍處於研究預覽階段,並未透露用於訓練模型的數據細節(除了約10,000小時的「高品質」視頻),也沒有將 Sora 普遍開放。其理由是潛在的濫用風險;OpenAI 正確指出,像 Sora 這樣的模型可能被不法分子以多種方式濫用。

OpenAI 表示,它正在與專家合作探索模型的漏洞,並正在開發工具來檢測視頻是否由 Sora 生成。該公司還表示,如果選擇將模型構建成面向公眾的產品,它將確保在生成的輸出中包含來源元數據。

OpenAI 寫道:「我們將與全球的政策制定者、教育工作者和藝術家進行接觸,以了解他們的擔憂,並識別這項新技術的積極用例。」「儘管進行了廣泛的研究和測試,我們無法預測人們將如何利用我們的技術,也無法預測人們將如何濫用它。這就是為什麼我們相信,從現實世界的使用中學習是隨著時間創建和發布越來越安全的人工智慧系統的關鍵組成部分。」

OpenAI 推出 ChatGPT 新功能:記憶與你的對話內容

隨著語音助手和聊天機器人的興起,記住上下文和用戶偏好變得越來越重要。2024年2月14日, OpenAI 為其流行的語言模型 ChatGPT 推出了全新功能,允許其記住與用戶之前的對話。這項功能將大大提高 ChatGPT 的個性化和上下文意識。

影片來源:OpenAI X

ChatGPT 新功能介紹


這項新功能允許 ChatGPT 記住它在對話期間學到的資訊。例如,如果你告訴 ChatGPT 你喜歡的食物或你最喜歡的書,它將記住這些偏好,並在未來的對話中參考,這可以使對話更加個性化和相關。對於企業和團隊用戶,這也意味著 ChatGPT 可以學習他們的風格和偏好,並相應地調整其回覆。此外,記憶功能還允許 ChatGPT 跟踪對話的上下文和進度。例如,如果你詢問一個複雜的問題,它可以在之後的對話中回顧和參考以前的資訊。這將大大提高長期任務和對話的效率。

用戶控制與隱私

用戶可以選擇啟用或禁用記憶功能。此外,用戶可以選擇 ChatGPT 忘記特定資訊,或完全重置其記憶。OpenAI 還實施了嚴格的隱私保護措施,以確保用戶數據的安全性。用戶提供的任何敏感內容都將受到保護,不會用於改進模型。

記憶功能的實際應用

ChatGPT 的記憶功能在很多場景下都大有用處。例如,它可以用於提供更加個性化的書籍或電影推薦,或者在教育領域,記住學生的學習進度和偏好。記憶功能也可以應用於規劃多日旅行行程。整體而言,這項功能將使 ChatGPT 的對話更加主動和個性化。

安全性與敏感資料處理

OpenAI 採取了嚴格的措施來確保記憶功能不會記住或泄露敏感資訊,例如醫療或金融記錄。此外,用戶可以隨時選擇重置 ChatGPT 的記憶。OpenAI 還允許用戶查詢 ChatGPT 已經學到的有關其個人的資訊。用戶可以選擇刪除這些記錄,有效地使 ChatGPT “忘記”特定資訊。這給予了用戶更多的控制權和透明度。

臨時聊天模式

除了完整的記憶功能外,OpenAI 還推出了臨時聊天模式。在這種模式下, ChatGPT 將進行對話但不記住任何內容。這相當於一種“隱私模式”,用於用戶不希望留下記錄的敏感對話。

記憶功能的測試與未來展望

OpenAI 稱記憶功能目前處於測試階段,預計在未來幾個月內面向更多用戶推出。隨著時間的推移,這項功能有望使 ChatGPT 的對話更加流暢和智能。最終,個性化的聊天機器人有望成為我們日常生活的一部分。

結語

OpenAI 推出的 ChatGPT 記憶功能標誌著語言模型的一大進步,將使其對話更加主動和個性化。這項功能仍在測試中,但未來用戶可以期待與 ChatGPT 之間更加流暢和有意義的長期對話。與此同時,OpenAI 也重視用戶隱私,允許用戶控制記憶功能和查詢已學習的資訊,這是語音助手領域的一大飛躍。

AI 藝術版權戰最新進展:Stability 和 Midjourney 如何在法庭上反擊藝術家的指控

AI 藝術版權戰持續升溫,Stability AI 、Midjourney 等公司近日在法庭上對藝術家的集體訴訟進行了強力反擊。這起源於美國視覺藝術家指控 AI 公司未經授權使用其作品訓練 AI 圖像生成模型的訴訟,隨著法院的初步裁決和 AI 公司的辯護策略,正朝著複雜的方向發展。

事情起源於2022年,藝術家 Kelly McKernan 、Karla Ortiz 和 Sarah Andersen 等人指控 AI 新創公司 Stability AI 、 Midjourney 、DeviantArt 以及 Runway ML 等公司,在未經授權的情況下使用包含他們作品的圖像數據集來訓練 AI 圖像生成模型,從而能夠生成新的高度相似的圖像,這侵犯了他們的版權。這些藝術家試圖通過法律途徑來制止這種行為並追究相關公司的法律責任。

最新的進展中,Midjourney 的訓練資料遭到曝光,其中包含超過16000筆未經授權的藝術家名單,這一事件無疑為這場訴訟增添了新的火藥味。這一發現不僅加深了公眾對 AI 藝術生成器合法性的疑慮,也為藝術家們的訴訟增添了新的論據。

然而,法院的初步裁決並不完全站在藝術家一邊。2022年10月底,加州北區聯邦地區法院法官 William H. Orrick 駁回了藝術家提出的大部分原始侵權主張。 Orrick 法官認為,藝術家並未在許多情況下真正尋求或獲得美國版權局的正式版權登記,這使得他們在法律上證明自己作品的獨特性和原創性非常困難。

儘管遭遇法院的初步打擊,藝術家群體並未放棄訴訟。2022年11月底,他們重新提交了經過修訂的訴狀,加入了更多原告,並提出了進一步的證據材料試圖支持他們的指控。與此同時,AI 公司也沒有坐以待斃,它們提出了大量法律文件和論據,力圖在法庭上取得勝利並完全駁回藝術家的集體訴訟。

AI 公司的主要辯護論點是,它們開發或提供的 AI 模型本身並不等同於任何藝術家作品的完整複製品。這些模型的訓練資料雖然包含了大量藝術圖像,但最終生成的模型更像是一種新的創作工具,能夠根據用戶的文字輸入提示生成全新的圖像。換言之,這些 AI 圖像生成器並不是單純地在機械化地複製或替代人類藝術家的創作過程。

法院對此論點也表示認同。Orrick 法官在他的裁決中指出,這些 AI 模型並不會在沒有用戶明確要求的情況下主動生成侵犯他人版權的內容,所以它們本身並不應該為可能的版權侵權行為負責。這為 AI 公司提供了重要的法律依據。

在法庭文件中,DeviantArt 也明確表態,認為它被列為被告完全是沒有道理的。 DeviantArt 所提供的只是一個開源的 AI 圖像生成工具 Stable Diffusion 的網絡接口,而該工具的開發者是 Stability AI 。 DeviantArt 主張,僅僅提供第三方開發的工具介面不應成為它被起訴的理由。

Runway ML 也在法庭上提出了自己的辯解。其表示在平台上運行的 AI 模型都是基於用戶提供的資料進行訓練的,並不涉及到未經授權使用藝術家作品的情形。 Runway ML 也強調,它並未在自己的服務器上存儲那些可能侵權的訓練用圖像資料。

在眾多被告中,Stability AI 面臨的法律壓力可能最大。該公司是 Stable Diffusion 等開源圖像生成模型背後的開發團隊,如果被證明其訓練資料中確實大量包含未經授權的藝術家作品,那麼它將成為藝術家集體訴訟的主要目標。

這場 AI 藝術版權大戰的每個新進展都在引發社會各界的廣泛關注。它直接挑戰了人類對藝術創作和知識產權的傳統理解,同時也對現有的法律體系提出了考驗。人工智能技術在文化創意領域的應用將面臨怎樣的法律和道德規範?人類智慧與算法之間的交互將如何平衡公平和效率?這場看似藝術家與科技公司之間的法庭戰爭,其實也是人性、道德和社會進步之間緊張關係的縮影。

這場針對 AI 藝術生成器的版權大戰,將是一個漫長的過程。法院的裁決很難在短期內出現定論,技術的發展也會給法律制度帶來新的挑戰。但可以確定的是,人類社會將在這場較量中不斷反思、磨合,並最終達成新的共識。這共識將兼容並蓄,代表了人性的智慧。它不會偏袒任何一方,但會努力實現技術進步與人文精神、效率與道德之間的和諧統一。

相關資訊

原告

  • 律師事務所:Lieff Cabraser Heimann & Bernstein, LLP
  • 主辦律師:Mark P. Rifkin
    • Lieff Cabraser Heimann & Bernstein, LLP 合夥人
    • 專注於複雜民事訴訟
    • 曾代理多起備受矚目的案件,包括 BP 石油泄漏案和通用汽車點火開關缺陷案

被告

Stability AI

  • 律師事務所:Cooley LLP
  • 主辦律師:Joshua A. Goldberg
    • Cooley LLP 合夥人
    • 專注於知識產權和技術訴訟
    • 曾代理多家知名科技公司,包括 Google 、 Amazon 和 Facebook

Midjourney

  • 律師事務所:Keker, Van Nest & Peters LLP
  • 主辦律師:John W. Keker
    • Keker, Van Nest & Peters LLP 合夥人
    • 專注於複雜民事訴訟
    • 曾代理多起備受矚目的案件,包括辛普森殺妻案和邁克爾·傑克遜娈童案

Runway

  • 律師事務所:Orrick, Herrington & Sutcliffe LLP
  • 主辦律師:David H. Kramer
    • Orrick, Herrington & Sutcliffe LLP 合夥人
    • 專注於知識產權和技術交易
    • 曾代理多家知名科技公司,包括蘋果、微軟和 Netflix

OpenAI 為 DALL-E3 添加浮水印,以提高數位資訊的可信度

OpenAI 於2024年2月6日宣布,為其 DALL-E3 圖像生成器添加新水印,行動用戶將在2月12日前看到這些水印,這些水印將包含不可見的元數據組件和可見的 CR 符號。此舉旨在提高數位資訊的可信度,並幫助人們識別由 AI 生成圖像。

DALL-E3 是一款強大的圖像生成器,可以根據文字描述生成逼真的圖像。自 2023 年推出以來,它已成為藝術家、設計師和其他創意專業人士的流行工具。

然而,隨著 AI 生成圖像的普及,人們也越來越擔心這些圖像可能被用於欺騙或誤導他人。例如,有人可能會使用 AI 生成圖像來創建虛假新聞文章或冒充他人。

為了解決這個問題,OpenAI 為 DALL-E3 添加了新水印。新水印是一個由 Adobe 和 Microsoft 等公司開發的 Content Credentials 符號。它包含有關圖像來源和創建方式的元數據。例如,水印可能包含以下資訊:

  • 圖像是由 DALL-E3 生成的
  • 圖像的創建日期
  • 圖像的創建者

OpenAI 首席執行官 Sam Altman 表示,新水印將有助於建立對 AI 生成圖像的信任。他說:「我們認為,重要的是要讓人們能夠識別 AI 生成圖像,並了解它們的來源。」

Adobe 和 Microsoft 等公司也表示支持 OpenAI 的舉措。Adobe 數位媒體部門副總裁 Scott Belsky 表示:「Content Credentials 是提高數位資訊可信度的重要工具。我們很高興看到 OpenAI 將其添加到 DALL-E3 中。」

專家表示,OpenAI 的新水印是一項積極的舉措,但它並不能完全解決 AI 生成圖像的信任問題。加州大學柏克萊分校資訊學院教授 danah boyd 表示:「水印是一個很好的第一步,但它並不能保證人們能夠識別 AI 生成圖像。我們需要教育人們了解 AI 生成的圖像,並幫助他們批判性地思考這些圖像。」

儘管存在一些挑戰,但 OpenAI 的新水印是提高數位資訊可信度的重要一步。它將有助於人們更好地了解 AI 生成圖像,並做出更明智的決策。

Google 重塑其人工智能聊天機器人品牌 Bard ,並推出了名為 Gemini Advanced 的訂閱版本

圖片由 Gemini Advanced 生成

Google 於 2023 年 2 月推出了人工智能聊天機器人 Bard,旨在為用戶提供一種更強大、更靈活的人工智能工具。Bard 使用了 Google 的最新人工智能技術,能夠生成文字、翻譯語言、編寫不同種類的創意內容,並以信息豐富的方式回答您的問題。

在推出一年後,Google 於 2024 年 2 月 7 日宣布,將 Bard 重塑為 Gemini,並推出了名為 Gemini Advanced 的訂閱版本。

YouTube thumbnailYouTube icon
影片來源: Google

Gemini 的新品牌名稱

Gemini 的新品牌名稱旨在反映其雙重身份:既是人工智能聊天機器人,也是人工智能語言模型。Gemini 一詞在拉丁語中是“雙胞胎”的意思,這代表了 Bard 作為人工智能聊天機器人和人工智能語言模型的雙重角色。

作為人工智能聊天機器人,Gemini 可以與用戶進行自然語言對話,幫助用戶完成各種任務,例如:

  • 生成創意內容,例如詩歌、程式碼、腳本、音樂作品、電子郵件、信件等
  • 以信息豐富的方式回答您的問題,即使它們是開放式的、具有挑戰性的或奇怪的翻譯語言

作為人工智能語言模型,Gemini 可以生成文本、翻譯語言、編寫不同種類的創意內容,並以信息豐富的方式回答您的問題。

Gemini Advanced 訂閱版本

Gemini Advanced 訂閱版本將為用戶提供以下附加功能:

  • 訪問 Google 最先進的人工智能模型,包括 Gemini Ultra
  • 更高的 API 調用限額
  • 專屬客戶支持

Gemini Ultra 是 Google 最先進的人工智能模型,它在多項基准測試中都超越了 ChatGPT 等競爭對手。Gemini Advanced 訂閱者將能夠訪問 Gemini Ultra,從而獲得最先進的人工智能功能。

Gemini Advanced 訂閱者還將獲得更高的 API 調用限額,這意味著他們可以更頻繁地使用 Gemini API。此外,Gemini Advanced 訂閱者還將獲得專屬客戶支持,這將幫助他們解決使用 Gemini 時遇到的任何問題。

Gemini 的重塑和 Gemini Advanced 的推出是 Google 在人工智能領域的重要里程碑。Gemini 將為用戶提供更強大、更靈活的人工智能工具,幫助他們提高工作效率和創造力。

(本報導由 Gemini Advanced 所創作)

筆者註:

  1. Google 官方表示 Gemini Advanced 現已在150個國家/地區推出,目前只支援英文版 ,但筆者實測中文對話都是正常沒問題的,若是有出現對話回覆不順暢不正常的地方,建議使用英文 prompt 比較能夠獲得較為精準的結果。
  2. 目前仍無法透過中文創作圖片,需要透過英文 prompt ,但已可以生成人物圖像。
  3. 所有個人用戶都可以免費獲得2個月的試用,無須支付費用。2個月試用期結束之後,每個月需支付20美元 (台幣650元),與 OpenAI 的 ChatGPT 付費方案相同。
  4. 與 Gmail 、 Docs 等 Google 應用的整合很快地就會推出。
  5. 訂閱 Gemini Advanced 可以免費獲得 2TB 的 Google One 儲存空間,而即日起至 2024 年 7 月 31 日,訂閱 5TB 以上 Google One 方案的使用者可限時存取 AI 進階版功能,不需額外付費。
  6. Google 官方表示 Gemini 應用程式將在美國針對特定裝置推出,並支援英文。未來 Gemini 將提供日文和韓文版,英文版也會拓展支援至全球,但不包括英國、瑞士及歐洲經濟區 (EEA) 國家及相關地域。很快就會開始支援更多國家/地區和語言。目前美國地區用戶可以使用 Android 裝置到 Google Play 商店下載 Gemini 應用程式,開始和 Gemini 對話;如使用 iOS 裝置,必須透過 Google 應用程式體驗 Gemini 服務。
  7. 筆者實測結果,Gemini Advanced 在文字創作能力已可與 GPT-4 Turbo 匹敵,但在整體生態及邏輯理解能力筆者認為仍與 GPT-4 Turbo 有一定的差距,尤其是圖片生成這塊跟 DALL-E 3 落差極大。不過這次 Google 放出2個月免費吃到飽的大絕,應可吸引不少原本 ChatGPT 3.5 及若干 GPT 付費方案用戶嘗鮮。
  8. Gemini Advanced 最大的特色在於即時自我檢討及修正的能力。它會先生成使用者的提示詞,接著提出具體建議,再根據具體建議再生成新的內容。筆者認為它會參考之前使用者與它的對話來判斷修正方案的內容,與 GPT 輸入自訂指令的方式不太一樣。這樣的方式對於初級使用者而言更為友好,但相對可控性也較差,面對複雜的需求更容易產生錯誤的輸出。
  9. 根據國外知名 AI 評論 YouTuber All About AI 的第一手評測:Gemini Advanced 在介面設計、回應速度上較 GPT-4 優秀,它的黑暗模式介面看起來很棒,還有即時回應等方便的功能。但是在推理能力、編碼能力以及創造力方面,Gemini Advanced 與 GPT-4 相比還有一段差距。在解釋編碼時 Gemini Advanced 表現失常,說自己「只是語言模型」;而 GPT-4 可以流暢地解釋 Python 代碼。在生成圖像時,Gemini Advanced 也承認自己「還不能生成圖像」。總體來說 Gemini Advanced 是 Google 在大型語言模型上的重要進步,它的速度和介面設計值得稱讚,但核心能力如推理、編碼和創造力還需要提升,才能真正與 GPT-4 一較高下。這次測試只是初步印象,未來如果 Gemini 在 API 和能力上有所改進,它的表現還有很大潛力。
  10. 根據 Gemini Advanced 自己的回覆,其企業版本 Gemini for Google Workspace (目前稱為 Duet AI in Google Workspace) 將於 2024 年下半年推出,具體的發佈日期尚未確定。而 Gemini for Google Workspace 的推出將是 Google Workspace 的重大更新,它有可能徹底改變用戶的工作方式。
進一步閱讀

Gemini Prompt 入門指南