您当前的位置:首页 > 新闻资讯 > 科技

谷歌Gemini:被神话的多模态和被低估的隐忍

时间:2023-12-11 10:57:36  来源:  作者:鞭牛士

google最强大的大模型Gemini发布了,陆续读了技术报告和一些评测/分析,周末记录和分享一下:

一、几点值得Mark的笔记

  1. Gemini Ultra的得分为90.0%,是第一个在MMLU(大规模多任务语言理解)上超过人类专家的模型,类似于高考。国内外也有类似的评测基准。

比如C-Eval/CMMLU/GaoKao/LucyEval/SuperClue/OpenCompass/FlagEval等等。

谷歌Gemini:被神话的多模态和被低估的隐忍

2. 此次Google对Gemini宣传突出的最大亮点——多模态。“Gemini设计成原生的多模态,从一开始就在不同的模态上进行预训练。助于Gemini从头开始无缝地理解和推理各种输入,远远优于现有的多模态模型——其能力在几乎每个领域都是最先进的。”

谷歌Gemini:被神话的多模态和被低估的隐忍

遵循 next token prediction 的方式,Gemini 把多模态数据从头训练,包括文本、图片、音频、视频等,所有模态数据转换为 token,最后变成一维线性输入(不同的模态按照颜色顺序标记),让模型预测 next token。

谷歌Gemini:被神话的多模态和被低估的隐忍

3. Google一口气发布了三个规格的模型:Ultra是最大的,对标GPT4和4V、还没有开放(12月13日开放API)。Pro对标GPT3.5,在美区Bard上可以用(我试了下我的Bard,还是之前的LaMDA)。Nano是小模型,在谷歌的Pixel 8手机上可以用。

谷歌Gemini:被神话的多模态和被低估的隐忍

4. 技术报告中,Google强调了算力优势:“我们宣布迄今为止最强大、高效和可扩展的TPU系统——Cloud TPU v5p ,旨在训练尖端的人工智能模型。”

翻译成大白话,就是:微软/AI target=_blank class=infotextkey>OpenAI/Anthropic这些公司,利润(据说70%)都被Nvidia吃了,我的利润还是自己的。(其实微软和OpenAI也在尝试自己做芯片,只是进度慢于Google。)

5. Gemini语音识别在主要语种上有大幅提升(Bleu值比OpenAI的Wisper 2高10个点,但在其他语种上Wisper更强。机器翻译能力在WMT2023的测试集上评测的结果,也比GPT4略高)。

二、一个简单的评测

没用视频,用这张图试了下一些有多模态能力的模型。方法是:上传这张图,然后问:从设计上看,图中哪个车会跑得更快?

谷歌Gemini:被神话的多模态和被低估的隐忍

百度文心4.0:

谷歌Gemini:被神话的多模态和被低估的隐忍

智谱清言:

谷歌Gemini:被神话的多模态和被低估的隐忍

ChatGPT的GPT4:

谷歌Gemini:被神话的多模态和被低估的隐忍

Google Bard(还不是Gemini Pro):

谷歌Gemini:被神话的多模态和被低估的隐忍

不多评论,不过四个同学都挺有意思~

三、几点想法

1. 关于多模态:实时处理声音、视频流、真实世界交互,意味着具身智能的一大步。可以实时接收信息并实时处理任务,更像人类的生活场景了。Google坐拥全球最大的视频网站YouTube,训练多模态模型条件优越。而且最近大火的文生图Midjourney和文生视频Runway/Pika,证明了多模态在商业上的潜力。

不过,从智能的角度说,多模态被神化了。相比于文本语言模型,多模态模型从智能上来说提升并不大,模型在理解、推理、创造方面并没有显著的提升。除了视频的训练难度,我猜想,我们低估了文本。Rust创始人Graydon Hoare说过:“所有的文学和诗歌、历史和哲学、数学、逻辑、编程和工程都依靠文本编码来表达它们的想法,这不是一个巧合”。

文本确实保存了人类智慧的精华,古今中外的智慧、对世界万物的认知和发现,自有人类文字记载以来,几乎都存到文本中。

一方面,GPT只是一个读了万卷书的“书呆子”,却已经能具备强大的常识、理解、推理和创造力,颇有点“不出户,知天下;不窥牖,见天道“的味道。另一方面,大自然这本书,到底怎么读?这似乎是一个巨大的问题。从真实世界学习知识,就像行万里路相比于读万卷书,低效太多。

2. Gemini没有现场演示,网传一些复现视频和Demo视频不符,有夸大宣传嫌疑。不过,从Bard不断缩小和ChatGPT差距的事实,以及Google综合能力判断,Gemini Ultra能力不会和宣传的出入太大。

Gemini这一仗奠定了AI领域的双子星格局,我们都低估了Google的隐忍。

从竞争格局看,无论是Meta的开源Llama2,还是主打安全的Anthropic、马斯克的X.ai,目前的差距都拉大了。

3. Google的优势有这些:

组织方面,今年年初DeepMind和Google Brain的合并,解决了力量分散和认知不统一的问题,化劣势为优势。

人才方面,领军人物是AlphaGo的推动者,对AGI理解深刻的Demi Hassabis,首席科学家是工程师传说级人物Jeff Dean。人数方面,技术报告作者栏的人数好几页,已将近千人。已经比OpenAI的人数多(七百多人)。

算力/算法/工程方面:算力上谷歌不像微软和OpenAI高度依赖英伟达,有Cloud TPU v5p。算法上,谷歌是Transformer的发明者,是一直以来算法的领头羊;还有搜索业务本身积累的底层算法和工程能力。

生态方面,Google C端强于微软,微软除了云主要是window/office,而Google拥有几乎微软+苹果的C端能力。另外,模型层和应用层都在一个体系下,动作应该比OpenAI和微软的联盟快。

4. 当然,OpenAI的优势至少也还有这些:

GPT4是3月就发布的,时间上领先了Gemini Ultra 9个月,过几个月是否会发布GPT5?

ChatGPT的是一个Killer App,紧随其后的GPT4发布,OpenAI占领了用户心智,GPT也几乎成了大模型的代名词。

全球一亿多用户形成的用户反馈和数据飞轮,大规模的落地已经铺开。

微软快得不像大公司的Copilot和Azure云渗透,OpenAI的创业心态,关于GPTs和GPT store的生态野望,都是厚实的肌肉。

5. 被神话的多模态前景,被低估的Google的隐忍,被加速的AI进程,被喧嚣淹没的AI风险提醒。

这可能是我们——依然处于早期矇昧的人类,在取得亘古未有的生产力跃迁前的徘徊,也有可能是文明充分发育后,在被硅基超越的悬崖边缘的试探。

不管怎么样,这注定是一段风起云涌,激荡数年,值得观察和记录的人类历史。



Tags:Gemini   点击:()  评论:()
声明:本站部分内容及图片来自互联网,转载是出于传递更多信息之目的,内容观点仅代表作者本人,不构成投资建议。投资者据此操作,风险自担。如有任何标注错误或版权侵犯请与我们联系,我们将及时更正、删除。
▌相关推荐
如何免费访问和使用Gemini API?
Gemini是谷歌开发的一个新模型。有了Gemini可以为查询提供图像、音频和文本,获得几乎完美的答案。 我们在本教程中将学习Gemini API以及如何在机器上设置它。我们还将探究各...【详细内容】
2024-02-19  Search: Gemini  点击:(59)  评论:(0)  加入收藏
从Google Gemini到OpenAI Q*:生成式AI研究领域全面综述
新智元报道来源:专知【新智元导读】这项综述性研究报告批判性地分析了生成式AI的发展现状和发展方向,并探究了谷歌Gemini和备受期待的OpenAI Q*等创新成果将如何改变多个领域...【详细内容】
2024-01-09  Search: Gemini  点击:(161)  评论:(0)  加入收藏
谷歌Gemini大逆转?斯坦福Meta华人证明其推理性能强于GPT-3.5
新智元报道编辑:编辑部【新智元导读】谷歌放出的Gemini,在对标GPT的道路上似乎一直处于劣势,Gemini真的比GPT-4弱吗?最近,斯坦福和Meta的学者发文为Gemini正名。Gemini的推理能力...【详细内容】
2024-01-02  Search: Gemini  点击:(71)  评论:(0)  加入收藏
谷歌创始人亲自给Gemini写代码,很核心那种
西风 发自 凹非寺量子位 | 公众号 QbitAI身价1050亿美元,每天还在亲自动手敲代码!?就连谷歌最新大招Gemini大模型的核心贡献者名单中,也有他的名字。没错,他就是谷歌联合创始人谢...【详细内容】
2023-12-26  Search: Gemini  点击:(106)  评论:(0)  加入收藏
谷歌Gemini扳回一局!多模态能力和GPT-4V不分伯仲|港中文128页全面测评报告
量子位 | 公众号 QbitAI谷歌扳回一局!在Gemini开放API不到一周的时间,港中文等机构就完成评测,联合发布了多达128页的报告,结果显示:在37个视觉理解任务上,Gemini-Pro表现出了和GP...【详细内容】
2023-12-22  Search: Gemini  点击:(117)  评论:(0)  加入收藏
谷歌Gemini“抄袭”百度文心一言?AI训练数据陷入大难题
谷歌过于心急,Gemini推出不到半月,就遭遇两次“危机”。美东时间12月6日,谷歌推出了迄今为止规模最大,能力最强的大模型Gemini。其原生多模态的能力,通过一条约6分钟的演示视频,展...【详细内容】
2023-12-21  Search: Gemini  点击:(124)  评论:(0)  加入收藏
谷歌Gemini自曝用百度文心一言训练
作者:匡达界面新闻记者 |李京亚 赵一帆临近欧美圣诞假期,就在业界吐槽GPT变懒之际,谷歌这边出现了更大纰漏。12月18日,有微博大V@阑夕及《AI研究局》等自媒体爆出,在对谷歌Gemini...【详细内容】
2023-12-18  Search: Gemini  点击:(95)  评论:(0)  加入收藏
Gemini 开启大模型路线之争,新战场将“数流成河”
谷歌上演了一出“ 那些没有杀死我的,将使我更强大”。互联网高速发展了几十年, 但全世界超过10亿用户的业务或者应用一共没超过20个, 而谷歌拥有6个。在绝大很多网民心目中,Goog...【详细内容】
2023-12-15  Search: Gemini  点击:(88)  评论:(0)  加入收藏
一个GPT的幽灵在Gemini上空徘徊
原文来源:硅基立场图片来源:由无界 AI生成每次Google在生成式人工智能领域祭出大招,都能让人感到一种隐秘且巨大的情绪力量:隐忍、不甘与较量。在5月的Google I/O上,Google发布Pa...【详细内容】
2023-12-11  Search: Gemini  点击:(234)  评论:(0)  加入收藏
谷歌Gemini:被神话的多模态和被低估的隐忍
Google最强大的大模型Gemini发布了,陆续读了技术报告和一些评测/分析,周末记录和分享一下:一、几点值得Mark的笔记 Gemini Ultra的得分为90.0%,是第一个在MMLU(大规模多任务语言...【详细内容】
2023-12-11  Search: Gemini  点击:(86)  评论:(0)  加入收藏
▌简易百科推荐
谷歌搜索史上最大变革!考虑对AI搜索收费
快科技4月7日消息,据国外媒体报道,谷歌正计划对由生成式人工智能驱动的新高级功能收费,这将是谷歌搜索业务历史上最大的一次变革。自2000年以来,谷歌的搜索产品一直依靠广告盈利...【详细内容】
2024-04-08    快科技  Tags:谷歌搜索   点击:(6)  评论:(0)  加入收藏
为训练AI,OpenAI等科技巨头花式淘数据
[环球时报特约记者 甄翔]《纽约时报》6日披露了科技公司训练人工智能的秘密——利用语音识别工具转录视频网站YouTube上的视频,形成对话文本数据,供其最新的AI学习...【详细内容】
2024-04-08    环球网  Tags:AI   点击:(6)  评论:(0)  加入收藏
当“机器人”有了“AI大脑” 人形机器人时代来了吗
数智风向标当“机器人”有了“AI大脑”​人形机器人时代来了吗简单明了的口令下达后,机器人便开始搬箱子、运小球,在各类不同的地形行走……这些身上布满芯片和传...【详细内容】
2024-04-08    中国青年报  Tags:机器人   点击:(3)  评论:(0)  加入收藏
报告称 OpenAI 采集了超一百万小时的 YouTube 视频来训练 GPT-4
IT之家 4 月 7 日消息,本周早些时候,《华尔街日报》报道称 AI 公司在收集高质量训练数据方面遇到了困难。今天,《纽约时报》详细介绍了 AI 公司处理此问题的一些方法,其中涉及到...【详细内容】
2024-04-07    IT之家  Tags:OpenAI   点击:(4)  评论:(0)  加入收藏
量子计算会和经典计算一样融入人们的日常生活
作为2024中国网络媒体论坛打造的创新活动之一,“技术赋能·八点见”创新项目发布会于3月30日晚在云南昆明举行。活动现场,本源量子计算科技(合肥)股份有限公司(以下简称“...【详细内容】
2024-04-03    人民网  Tags:量子计算   点击:(8)  评论:(0)  加入收藏
ChatGPT官宣免注册,全球互联网变天!OpenAI将取代谷歌搜索?
新智元报道编辑:编辑部【新智元导读】OpenAI这份愚人节礼物,实在是太大了:今天起,ChatGPT不用注册,可以直接使用。用户狂欢,竞品颤抖,我们仿佛已经听到,谷歌搜索引擎这位巨人轰然倒...【详细内容】
2024-04-02    新智元  Tags:ChatGPT   点击:(7)  评论:(0)  加入收藏
谷歌为了结集体诉讼,同意删除 Chrome 无痕模式下收集的用户数据
IT之家 4 月 2 日消息,根据华尔街日报报道,谷歌为了结追溯到 2020 年的集体诉讼案,近日同意删除通过 Chrome 浏览器“无痕(Incognito)模式”下收集的用户数据。这起诉讼原告认为,...【详细内容】
2024-04-02    IT之家  Tags:Chrome   点击:(7)  评论:(0)  加入收藏
哥伦比亚大学华人开发「人脸机器人」,照镜子自主模仿人类表情超逼真
【新智元导读】OpenAI 机器人理解力虽强,却无法进行非语言交流。最近,哥伦比亚大学华人团队打造了全新的机器人 Emo,不仅可以提前预测和模拟人类表情,还可以进行眼神交流。此前,...【详细内容】
2024-04-01    IT之家  Tags:哥伦比亚   点击:(17)  评论:(0)  加入收藏
谷歌服务现已支持使用 Windows Hello 人脸和指纹解锁登录
IT之家 3 月 28 日消息,谷歌近日对其账户登录页面进行了重大更新,现在能够在用户登录谷歌账户时,使用 Windows Hello 作为身份验证方法。使用通行密钥,用户将不再局限于使用密码...【详细内容】
2024-03-29    IT之家  Tags:谷歌服务   点击:(15)  评论:(0)  加入收藏
GPT商店热度不尽人意 仅用在写论文和炒股票上较受欢迎
财联社3月28日讯(编辑 赵昊)今年1月,OpenAI推出了定制聊天机器人商店“GPTs”,以期为业务增添新的动力。但两个多月后,GPTs的吸引力仍然有限,很难达到公司CEO山姆·奥尔特曼...【详细内容】
2024-03-29    财联社  Tags:GPT   点击:(13)  评论:(0)  加入收藏
站内最新
站内热门
相关头条
  • · 谷歌搜索史上最大变革!考虑对AI搜索收费
  • · ChatGPT官宣免注册,全球互联网变天!OpenAI将取代谷歌搜索?
  • · 马斯克脑机接口再造奇迹:瘫痪小伙意念玩赛车击败正常人
  • · Kimi引燃大模型“长文本竞赛”,阿里360百度急出手
  • · 瘫痪8年小哥植入马斯克脑机接口,狂打8小时「文明6」!Neuralink首个人类植入者直播来了
  • · 英伟达“算力核弹”强在哪里?
  • · AI大模型之争远未落幕
  • · 世界首款!英伟达重磅发布人形机器人模型
  • · 全程回顾黄仁勋GTC演讲:Blackwell架构B200芯片登场
  • · 真“Open ” AI?马斯克旗下大模型Grok宣布开源:参数量全球最大
  • · 全球首位AI程序员诞生 人类程序员会失业吗?
  • · 谷歌宣布更新搜索算法:打击AI生成内容,提高搜索结果质量
  • · 英伟达、微软等巨头“抱团”,AI有望助推6G时代到来 国内产业如何接招?
  • · OpenAI Sora已开放对外申请 网友爆料:可能还有其它重磅产品发布
  • · 周鸿祎再谈Sora:真正给人工智能补上了“眼睛”
  • · Sora爆火超100小时:美国狂“卷”算力,国内则卖 AI 课程“捞金”一年5000万|钛媒体AGI
  • · 爆火Sora参数规模仅30亿?谢赛宁等大佬技术分析来了
  • · “AI女友”霸占GPT商店,OpenAI苦不堪言:开发者也难出头!
  • · 从居家到工作,CES 2024上演 AI硬件大秀
  • · OpenAI新年头号重磅!GPT Store上线,企业客户新品也来了
  • 站内头条