新车测评网_网罗汽车评测资讯_汽车评测门户报道

首頁 > 汽車活動 > 汽車活動 > 谷歌對壘OpenAI,誰更勝一籌?

谷歌對壘OpenAI,誰更勝一籌?

發布時間:2024-05-17 23:13:19來源: 15210273549

中國戰略新興產業融媒體記者 艾麗格瑪

當地時間5月14日,谷歌在2024 Google I/O大會上展示了其在AI技術上的一系列突破。就在一天前,OpenAI發布的GPT-4o已經引發了一波熱議,而發布時間僅差一天的兩個技術產品被視為是這兩家科技企業在AI領域真刀明槍的激烈對壘。

谷歌和OpenAI的發布會,不約而同地強調了AI與現實世界的真正交互——例如用攝像頭感知環境、識別內容和互動。不過,在產品功能重點方面,兩家公司各有千秋。

那么,最新的AI大模型到底能做到什么程度?它們能帶來生產力的質變,還是僅僅停留在概念性的炒作?

01

各有側重的階段性更新

當地時間5月13日,OpenAI通過直播展示了產品更新。

這次,OpenAI并未推出搜索引擎,也未推出GPT-4.5或GPT-5,而是發布了GPT-4系列新模型GPT-4o以及AI聊天機器人ChatGPT的桌面版本。這可以看作是對GPT-4的一次階段性更新,而根據OpenAI官方網站介紹,GPT-4o中的“o”代表Omni,也就是“全能”的意思。

據介紹,GPT-4o文本、推理、編碼能力達到GPT-4 Turbo水平,速度是上一代AI大模型GPT-4 Turbo的兩倍,但成本僅為GPT-4 Turbo的一半,視頻、音頻功能得到改善。OpenAI公司CEO山姆·奧爾特曼在博客中表示,ChatGPT免費用戶也能用上新發布的GPT-4o。此外,OpenAI還與蘋果走到一起,推出了適用于macOS的桌面級應用。

OpenAI技術負責人Mira Murati在直播中表示:“這是我們第一次在易用性方面真正邁出的一大步。”

OpenAI將GPT-4o定位為GPT-4性能級別的模型。據介紹,GPT-4o在傳統基準測試中,文本、推理、編碼能力達到GPT-4 Turbo的水平。該模型接收文本、音頻和圖像輸入時,平均320毫秒響應音頻輸入,與人類對話中的響應時間相似,英文文本和代碼能力與GPT-4 Turbo相當,在非英文文本上有改善,提高了ChatGPT針對50種不同語言的質量和速度,并通過OpenAI的API提供給開發人員,使其即時就可以開始使用新模型構建應用程序。

與之形成對比的是,谷歌終于將自己在搜索領域的強項融入了AI產品:比如“Ask with video”,利用Gemini的多模態能力與Google Lens相結合,可以實現視頻搜索——錄制一段視頻,就能知道用戶使用唱片機,甚至維修照相機;Google Photos中還推出了新的AI功能“Ask Photos”,可以通過簡單的提問在大量照片中找出“孩子多年來學習游泳的歷程”。

谷歌版 AI 搜索的輸出結果不再是網址的羅列,而是一個全新的整合頁面——它更像一份針對用戶提問而形成的報告,不僅包括對問題本身的回答,也包括對用戶可能忽略問題的猜測和補充。

在大會上,谷歌搜索部門負責人Liz Reid表示,“生成式AI搜索將為你做的比你想象更多。不管你腦子里在想什么,或者你需要做什么,只要問,谷歌就會為你搜索。”她解釋說,AI概述在收到一個一般查詢后會提供一系列潛在答案,并鏈接到更深入的內容。它還能通過在搜索中使用“多重推理”在幾秒鐘內回答更復雜的問題和子問題。

谷歌同樣展示了現實交互功能,其一款名為Project Astra的多模式AI助手,可以觀看并理解通過設備攝像頭看到的內容,記住用戶的東西在哪里,幫用戶在現實世界搜索物品,或是完成其他任務。

但是,相比于OpenAI簡單直接的視頻說明,谷歌在現場演示的AI工具卻遭遇“翻車”。

開場時,一位從舞臺上的茶杯中鉆出的DJ,在臺上使用谷歌內部開發的一款AI DJ小工具 MusicFX DJ,在舞臺上現場用隨機生成的關鍵詞,來創造出一首曲目——很可惜,創造出的曲調有點糟糕。

不過,相比于2023年在演示Gemini后的“群嘲”,今年谷歌DeepMind推出的Project Astra使用視頻顯得更加可信:操作者以智能手機為媒介,讓大模型實時收集環境中的各種信息,并在圍繞著辦公室轉了一圈后突然提問:“你記得眼鏡在哪里嗎?”AI從環境信息中捕捉到了眼鏡的位置,并給出了正確的方位提示。

02

多模態成為重點

在直播中,OpenAI演示了一段員工與GPT-4o對話的視頻,模型反應速度與人類相近,GPT-4o可利用手機攝像頭描述其“看到”的東西。另一段展示視頻里,GPT-4o被裝在兩個手機上,其中一個代表人類與電信公司打電話溝通設備更換事項,另一個GPT-4o扮演電信公司客服人員。OpenAI還展示了GPT-4o搭載在手機上的實時翻譯能力。

GPT-4o的發布,標志著OpenAI在多模態AI領域的重大突破。這款新模型不僅能夠實時對音頻、視覺和文本進行推理,還能夠生成文本、音頻和圖像的任意組合輸出,大大提升了與人類的交互體驗。GPT-4o的響應速度極快,音頻輸入的平均響應時間僅為320毫秒,與人類對話中的自然反應時間相當。此外,GPT-4o在多語言處理、視覺和音頻理解方面的能力也有顯著提升,創下了多項新的行業紀錄。

根據OpenAI介紹,GPT-4o與GPT-3.5、GPT-4的語音對談機制不同。GPT-3.5和GPT-4會先將音頻轉換為文本,再接收文本生成文本,最后將文本轉換為音頻,經歷這三個過程,音頻中的情感表達等信息會被折損,而GPT-4o是跨文本、視覺和音頻的端到端模型,是OpenAI第一個綜合了這些維度的模型,可更好進行對談。

而如前所述,谷歌本次發布的AI Overview,也在多模態的問題上做足了文章。

那么,“多模態”到底是什么?

多模式深度學習,是一個機器學習的子領域,旨在訓練人工智能模型來處理和發現不同類型數據——也就是模式之間的關系,通常是圖像、視頻、音頻和文本。通過結合不同的模態,深度學習模型可以更普遍地理解其環境,因為某些線索僅存在于某些模態中。

例如一個能夠識別人類面部情緒的任務,它不僅需要AI看一張人臉(視覺模態),還需要關注人聲音(音頻模態)的音調和音高,這些內容編碼了大量關于他們情緒狀態的信息,這些信息可能無法通過他們的面部表情看到,即使他們經常是同步的。

在多模態深度學習中,最典型的模態是視覺(圖像、視頻)、文本和聽覺(語音、聲音、音樂)。其他不太典型的模式包括3D視覺數據、深度傳感器數據和LiDAR 數據,這是在自動駕駛汽車中經常用到的典型數據。

此外,在臨床實踐中,成像方式包括計算機斷層掃描(CT)掃描和X射線圖像,而非圖像方式包括腦電圖(EEG)數據。傳感器數據,如熱數據或來自眼動追蹤設備的數據也可以包含在列表中。

多模態神經網絡通常是多個單模態神經網絡的組合。例如,視聽模型可能由兩個單峰網絡組成,一個用于視覺數據,一個用于音頻數據。這些單峰神經網絡通常分別處理它們的輸入。這個過程稱為編碼。在進行單峰編碼之后,必須將從每個模型中提取的信息融合在一起。已經提出了多種融合技術,范圍從簡單的連接到注意機制。多模態數據融合過程是最重要的成功因素之一。融合發生后,最終的“決策”網絡接受融合后的編碼信息,并接受最終任務的訓練。

可以看出,要想讓停留在“畫畫寫字唱歌”程度的AI們真正與現實世界產生交互并影響生產過程,多模態研發是必經之路。

汽車活動更多>>

豐田上海車展主題:直面問題所在,研產供銷全面中國化 同級唯一天地門,空間堪比A+級,東風納米06再次顛覆國民車 吉利銀河星耀8:以豪華平權,再創“爆款” 長安汽車,銷量漲了、利潤跌了 傳祺向往 M8 內飾官圖發布!提供 7 座布局,搭載 2.0T 插混動力 方程豹鈦 3 將于 4 月 16 日上市!采用純電動力,配備一鍵漂移模式 廣汽 CC4 概念車官圖發布!配鷗翼門設計 新款 Jeep 大切諾基諜照曝光!外觀內飾升級,定位中大型 SUV 汽車業加速重組并購最新成果:一汽或成零跑大股東 上汽之夜:懂車更懂你!上汽制造進階,共創美好出行 上汽大通G50混動:重塑10萬級MPV價值標準! 比亞迪580KW超級電機銘牌曝光:轉速30500轉/分鐘全球第一 2024年全年銷量3143.6萬輛,增長4.5%,47.5%新能源滲透率,585.9萬輛全球第一出口量 豐田純電車型終端售價“崩盤” 消息稱bZ3裸車只要9萬多 小鵬汽車新總部2025年啟用,辦公空間翻三倍,打造智能車庫 恢復序幕與尾聲,李六乙版話劇《雷雨》令人耳目一新 新華文創攜手FILA FUSION推出系列活動,用非遺開啟新年 游戲成為文旅新引擎?上海游戲賦能商旅文體展融合發展的實踐 晨光加速年輕化布局:聯動騰訊視頻《斬神》,力拓二次元千億藍海 廣州“賀·歲”今日開展,系海昏侯相關展覽首次在廣州展出 信也科技顧鳴:東南亞數字金融市場正在加速接近成熟地區 福特游騎俠Ranger FX4沙狐版來襲,越野性能再升級,售價28.58萬起 “一車抵三車” 長安啟源E07迎來OTA升級 優雅的英國敞篷跑車,2門4座布局,V8發動機、665馬力、加速3.5s 宏光MINIEV四門版來襲,小巧便捷,女友直呼開車出門超方便! 溜背造型+掀背尾門,后置后驅+5.9秒破百,體驗東風風行星海S7 搭載全球最強電機 比亞迪唐L實車曝光:自帶車頂無人機艙 三菱翼神改裝AIRBFT氣動避震底盤升降案例 雙電機、四驅、650馬力,27英寸大屏,這內飾看著可太有檔次了! 2025年溫州永嘉縣事業單位引進博士研究生公告
主站蜘蛛池模板: 杭州|上海贴标机-百科| 小港信息港-鹤壁信息港 鹤壁老百姓便民生活信息网站 | 盘煤仪,盘料仪,盘点仪,堆料测量仪,便携式激光盘煤仪-中科航宇(北京)自动化工程技术有限公司 | 郑州爱婴幼师学校_专业幼师培训_托育师培训_幼儿教育培训学校 | 螺钉式热电偶_便携式温度传感器_压簧式热电偶|无锡联泰仪表有限公司|首页 | 湖州织里童装_女童男童中大童装_款式多尺码全_织里儿童网【官网】-嘉兴嘉乐网络科技有限公司 | 爆破器材运输车|烟花爆竹运输车|1-9类危险品厢式运输车|湖北江南专用特种汽车有限公司 | 百度爱采购运营研究社社群-店铺托管-爱采购代运营-良言多米网络公司 | 一体化净水器_一体化净水设备_一体化水处理设备-江苏旭浩鑫环保科技有限公司 | 创富网-B2B网站|供求信息网|b2b平台|专业电子商务网站 | 江西自考网-江西自学考试网| 水轮机密封网 | 水轮机密封产品研发生产厂家 | 冷凝锅炉_燃气锅炉_工业燃气锅炉改造厂家-北京科诺锅炉 | 北京翻译公司_同传翻译_字幕翻译_合同翻译_英语陪同翻译_影视翻译_翻译盖章-译铭信息 | 范秘书_懂你的范文小秘书| 精密模具-双色注塑模具加工-深圳铭洋宇通 | 苏州防水公司_厂房屋面外墙防水_地下室卫生间防水堵漏-苏州伊诺尔防水工程有限公司 | 微水泥_硅藻泥_艺术涂料_艺术漆_艺术漆加盟-青岛泥之韵环保壁材 武汉EPS线条_EPS装饰线条_EPS构件_湖北博欧EPS线条厂家 | PSI渗透压仪,TPS酸度计,美国CHAI PCR仪,渗透压仪厂家_价格,微生物快速检测仪-华泰和合(北京)商贸有限公司 | 华中线缆有限公司-电缆厂|电缆厂家|电线电缆厂家 | 成都珞石机械 - 模温机、油温机、油加热器生产厂家 | 双齿辊破碎机-大型狼牙破碎机视频-对辊破碎机价格/型号图片-金联机械设备生产厂家 | 预制围墙_工程预制围墙_天津市瑞通建筑材料有限公司 | 智能气瓶柜(大型气瓶储存柜)百科 | 一体化污水处理设备_生活污水处理设备_全自动加药装置厂家-明基环保 | 标准件-非标紧固件-不锈钢螺栓-非标不锈钢螺丝-非标螺母厂家-三角牙锁紧自攻-南京宝宇标准件有限公司 | 立式硫化罐-劳保用品硫化罐-厂家直销-山东鑫泰鑫硫化罐厂家 | 袋式过滤器,自清洗过滤器,保安过滤器,篮式过滤器,气体过滤器,全自动过滤器,反冲洗过滤器,管道过滤器,无锡驰业环保科技有限公司 | 仓储货架_南京货架_钢制托盘_仓储笼_隔离网_环球零件盒_诺力液压车_货架-南京一品仓储设备制造公司 | 发电机组|柴油发电机组-批发,上柴,玉柴,潍柴,康明斯柴油发电机厂家直销 | 耐高温风管_耐高温软管_食品级软管_吸尘管_钢丝软管_卫生级软管_塑料波纹管-东莞市鑫翔宇软管有限公司 | 天津蒸汽/热水锅炉-电锅炉安装维修直销厂家-天津鑫淼暖通设备有限公司 | 锡膏喷印机-全自动涂覆机厂家-全自动点胶机-视觉点胶机-深圳市博明智控科技有限公司 | 奥运星-汽车性能网评-提供个性化汽车资讯 | 不锈钢钢格栅板_热浸锌钢格板_镀锌钢格栅板_钢格栅盖板-格美瑞 | 电解抛光加工_不锈钢电解抛光_常州安谱金属制品有限公司 | 防勒索软件_数据防泄密_Trellix(原McAfee)核心代理商_Trellix(原Fireeye)售后-广州文智信息科技有限公司 | 济南品牌包装设计公司_济南VI标志设计公司_山东锐尚文化传播 | 仿清水混凝土_清水混凝土装修_施工_修饰_保护剂_修补_清水混凝土修复-德州忠岭建筑装饰工程 | 电缆隧道在线监测-智慧配电站房-升压站在线监测-江苏久创电气科技有限公司 | 无痕胶_可移胶_无痕双面胶带_可移无痕胶厂家-东莞凯峰 |