当前所在位置:首页 > 股票配资安全的平台

谷歌深夜放大招!最强大模型Gemini能打败GPT4吗?

3434

2024-05-17 【 字体:

在一段视频中,一个男子做出后仰并躲避的慢动作,AI马上猜出:这是表演《黑客帝国》中“子弹时间”的场景。

当人类拿起画笔在一张纸上勾勒出一只鸭子,并为它涂上了蓝色。这次AI说道:“这可不是鸭子常见的颜色。”

三个空杯并排放在桌子上,一张蓝色纸团被塞进其中一个杯子里,在人类一番眼花缭乱的操作后,AI准确地猜出:“纸团在最左边的杯子里!”

“喂”给AI一张手写的物理题图片,它不仅能看懂,而且还能分辨手写答案的对错,并给出一步步解决问题的细节。

上传食材图像和语音输入,AI不仅可以指导你做菜,还能在不同阶段提出相应的建议。

这些片段,是Google演示其在12月6日最新出炉的AI大模型Gemini的场景。

“我们离新一代人工智能模型的愿景越来越近了。”一系列视频演示后,Google DeepMind产品副总裁Eli Collins(伊莱·柯林斯)对包括第一财经在内的媒体说,这是Google迄今为止功能最强大、最通用的大模型。

和市面上现有大模型相比,Gemini从一开始就被创建为多模态的模型,这意味着它可以归纳并流畅地理解、操作以及组合不同类型的信息,包括文本、代码、音频、图像和视频。在灵活度上,从数据中心到移动设备上,它都能够运行。

Gemini被视作是Google在AI大模型领域放出的“大招”。多年前,Google凭借AlphaGo的惊艳表现在全球掀起了一波AI浪潮。但这一次,在OpenAI的ChatGPT所引发的AI新浪潮中,Google面临不小的压力。眼下,Google迫切需要一款现象级AI产品,证明自己在人工智能领域的实力。

能打败GPT4吗?

就在Google发布最新大模型之前,微软刚刚宣布了旗下AI助手Copilot重大升级,将接入OpenAI的最新模型GPT-4 Turbo。

“迟到总比不做好!终于有了OpenAI王座的有力竞争者。”在Google公布消息后,英伟达AI科学家Jim Fan(范麟熙)第一时间转发并评论。

Google CEO Sundar Pichai(桑达尔・皮查伊) 评价,Gemini这一新时代的模型代表了Google作为一家公司在科学和工程方面所做的最大努力之一。他同时提到,这也是Google今年早些时候成立 Google DeepMind 时的愿景首次实现。

今年4月,或许是感受到了 OpenAI 联手微软带来的挑战,以及为了加速实现通用人工智能(AGI)的目标,Google将曾经诞生了Tensorflow与Transformer 的Google Brain 团队,和凭借AlphaGo掀起上一轮AI热潮、创造了AlphaFold预测蛋白质折叠的DeepMind 团队合并,成立 Google DeepMind,这一团队也被外界调侃是“AI复仇者联盟”。原Google AI产品负责人Eli Collins就是在那时开始担任起新团队的产品副总裁。

今日Google Deepmind发布第一个版本 Gemini 1.0 ,针对不同尺寸进行了优化,分别是Ultra、Pro 和 Nano。其中Gemini Ultra是目前Google规模最大、功能最强大的模型,适用于高度复杂的任务;Gemini Pro是适用于可扩展各种任务的模型;Gemini Nano主要是端侧设备上的模型。

Gemini发布后,外界最关心的是其对OpenAI GPT4的挑战。在采访中,记者提问Eli Collins :“Gemini能打败市面上包括GPT4在内所有的大模型吗?”

Eli Collins在回答中表示,团队一直在对 Gemini 模型进行严格的测试并评估其在各种任务中的性能。从自然图像、音频和视频理解到数学推理,在被大型语言模型(LLM)研究和开发中广泛使用的 32 项学术基准中,Gemini Ultra 的性能有 30 项都超过了目前最先进的水平。

他援引了来自MMLU的测试结果,称Gemini Ultra 的得分率为 90%,是第一个在 MMLU测试中超过人类专家的模型,MMLU 综合使用了数学、物理、历史、法律、医学和伦理等 57 个科目,用于测试世界知识和解决问题的能力。作为对比,人类专家的得分率为89.8%,GPT4得分率为86.4%。

在多模态方面,Gemini Ultra在新的MMMU基准测试中也获得了59.4%的SOTA分数。这项基准测试是由跨不同领域的多模式任务组成,需要大模型进行一个深思熟虑的推理过程。

在包括文本和编码在内的一系列基准测试中, Gemini 的性能都超过了当前最先进的水平。

Goolge Gemini大模型多模态背后的技术原理也引发业界关注。Goolge DeepMind首席科学家杰夫·迪恩团队为此撰写了60页技术报告来阐述。

到目前为止,创建多模态模型的标准方法是分别训练不同模态的组件,然后将它们拼接在一起,以粗略模拟某些功能。这些模型有时可以很好地完成描述图像等特定任务,但在概念性更强、更复杂的推理方面却显得力不从心。

据DeepMind CEO Demis Hassabis(戴密斯·哈萨比斯)透露,团队将 Gemini 设计为原生多模态,从一开始就在不同模态上进行预训练。然后,利用额外的多模态数据对其进行微调,以进一步提高其有效性。这有助于 Gemini 从最初阶段就能对输入的各种内容顺畅地进行理解和推理,并优于现有的多模态模型。

复杂的多模态推理能力能够帮助理解复杂的书面和视觉信息。这使得它可以在海量的数据中发掘难以辨别的知识内容,回答与复杂主题相关的问题,尤其擅长解释数学和物理等复杂科目中的推理。

以解题为例,利用Gemini的多模态推理能力,AI能够读懂字迹凌乱的手写内容,正确理解问题的表述,还能够把问题和解决方案都转换为数字排版,识别出人类在解决问题时出错的具体推理步骤,并一步步给出问题的正确解决方案。

此外,它拥有通过阅读、过滤以及理解信息,从数十万份文件中提取数据集和观点的能力,有助于在从科学到金融等多个领域以数字化速度实现新的突破。

而在Gemini多模态大模型的背后,是由 Google 自研的云芯片 TPUs v4 和 v5e 在通过 AI 优化过的基础设施上,对 Gemini 1.0 进行大规模训练。

当天,Google还发布了最新的 TPU 系统 Cloud TPU v5p,称训练速度比前代快2.8倍,有望帮助开发者和企业客户更快地训练大规模生成式 AI 模型。

Google 数据中心内一排 Cloud TPU v5p AI 加速器超级计算机。来源:Google官方

应用层比拼刚刚开始

目前看起来,在“跑分”上Google Gemini更胜一筹,但接下来,更重要的是各家大模型在实际应用中的比拼。

Eli Collins 在接受第一财经等媒体采访时说,Google希望建立新一代AI模型,它是由人们对世界的理解和互动而激发的,人工智能更像是一个乐于助人的合作者,而不像是一个聪明的软件。

目前,Google旗下的聊天机器人Bard已经集成Gemini Pro的微调版本,在170多个国家和地区提供英语服务,并且计划在未来几个月内扩展不同的模态,并支持新的语言和地区。明年年初,Google还将推出Bard Advanced,提供Gemini Ultra模型的最佳性能。

在移动设备端,Google的Pixel 8 Pro成为首款搭载Gemini Nano的智能手机,它可以支持录音总结、智能回复等AI功能,明年还将推出更多信息应用。

基于定制版的Gemini,谷歌推出了代码生成系统AlphaCode 2。Google称,在面对不仅涉及编程,还涉及复杂的数学和计算机科学理论等领域的问题时,AlphaCode 2都表现出了卓越的性能。

未来几个月,Gemini 将应用于Google更多的产品和服务,如 Search、Ads、Chrome 和 Duet AI。

据透露,Google已经开始在 Search 中试验 Gemini,它能够为用户提供更快的搜索生成体验(SGE),用户在美国的英语搜索延迟降低了 40%,同时在质量方面也有所提高。

而对于Google采取哪些努力来防止Gemini产生幻觉和事实错误,或被用来创造危险的工具和其他不道德的用途,Google方面人士也对记者进行了解答。

Google基础设施与系统副总裁Amin Vahdat(阿明·瓦达特)对记者表示,Gemini在开发的各个阶段都会考虑潜在的风险,并努力进行测试和降低这些风险。

他透露,Gemini的安全评估包括偏见和毒性评估,并应用了 Google Research 的对抗性测试技术,帮助在部署 Gemini 之前检测关键的安全问题。

例如,为了在 Gemini 的训练阶段诊断内容安全问题,并确保其输出符合政策,Google团队使用了一些基准测试,例如真实毒性提示(Real Toxicity Prompts),这是一套由 Allen Institute of AI 的专家开发的基准测试,包含了从网络上提取的 10 万条具有不同程度毒性的提示。

此外,为了减少伤害,团队还构建了专门的安全分类器来识别、标记和筛选涉及暴力或负面刻板印象等方面的内容。“此外,我们正继续解决模型面临的已知挑战,例如事实性、基础、归因性以及协作性。”

Google没有透露未来是否会专门为Gemini定制应用程序,但高管对记者表示,更加希望看到用户在这种技术的基础上创建更多的应用程序。

Google透露,从 12 月 13 日开始,开发者和企业客户可以通过 Google AI Studio 或Google Cloud Vertex AI中的 Gemini API 获取 Gemini Pro。

目前Google正对 Gemini Ultra 完成大规模的信任和安全检查,包括由可信赖的外部团队进行红队测试,并在其被广泛应用前通过微调和人类反馈强化学习(RLHF)进一步完善模型。在这一过程中,Google 将向部分客户、开发者、合作伙伴以及安全和责任专家提供 Gemini Ultra,以供其进行早期试验和提供反馈。

据记者了解,Google将在明年初向开发者和企业客户提供该模型。

举报 第一财经广告合作,请点击这里此内容为第一财经原创,著作权归第一财经所有。未经第一财经书面授权,不得以任何方式加以使用,包括转载、摘编、复制或建立镜像。第一财经保留追究侵权者法律责任的权利。 如需获得授权请联系第一财经版权部:021-22002972或021-22002335;banquan@yicai.com。 文章作者

刘佳

关键字

谷歌大模型GeminiAI多模态大模型

相关阅读 书生·浦语2.0正式开源,回归语言建模本质,综合性能领先开源社区

1月17日,书生·浦语2.0(InternLM2)发布会暨书生·浦源大模型挑战赛启动仪式在上海举行。

01-18 14:15 2023年国内大模型发展盘点(一)——大模型发展趋势

“十四五”期间,国家出台了针对人工智能的未来发展相关指导方案和激励政策,涵盖“新型基础设施”建设、人工智能标准化与法规以及AI安全体系建设等。过去的2023年作为承上启下之年,如何总结评估前期成果并调整优化策略将成为规划实施的重要一环。而大语言模型作为人工智能领域最引人注目的成果之一,近年来已经经历了迅速崛起的历程,2020年Open AI GPT-3模型的发布更是极大推动了公众对于大语言模型的关注度。本系列文章将分别回顾2023年国内大模型发展重要趋势,比对中美大模型发展水平明确自身缺陷及劣势,并针对未来国内大模型发展给出针对性建议。本文将概括2023年国内大模型发展重点趋势,分别从模型规模、应用场景、技术创新、跨模态大模型以及产业化角度介绍年度发展。

01-14 22:55 国内大模型创新发展与软硬件协同生态论坛在上海徐汇成功举办

2023年12月28日下午,国内大模型创新发展与软硬件协同生态论坛在上海徐汇成功举办。

01-02 14:07 记录托举智能时代的力量,商汤入选第一财经《2023数字中国年度案例》

这背后,是商汤成立9年来在AI领域的坚定投入和扎实运营。

2023-12-19 20:32 字节跳动回应被OpenAI暂停访问API 大模型全球竞争升级

字节跳动周一回应第一财经记者称,其使用OpenAI的技术来帮助开发自己的人工智能大模型,符合这家美国公司的服务条款,并未涉及利用OpenAI技术构建竞争性的产品。

2023-12-18 14:12 一财最热 点击关闭

阅读全文
相关推荐

港股异动 汽车街(02443)跌超8%创新低 较招股价累计破发四成 公司近年业绩承压

港股异动  汽车街(02443)跌超8%创新低 较招股价累计破发四成 公司近年业绩承压
汽车街(02443)跌超8%,低见5.69港元创上市新低。较招股价10.2港元累...

存在重大生产安全事故隐患,东莞一重点项目被“点名”

存在重大生产安全事故隐患,东莞一重点项目被“点名”
近日,东莞市住建局发布《房屋市政工程重大生产安全事故隐患治理挂牌督办通知书》(下...

海航控股(600221SH):6月旅客运输量同比增长462%

海航控股(600221SH):6月旅客运输量同比增长462%
格隆汇7月15日丨海航控股(600221)(600221.SH)公布,2024年...

万达电影(002739)6月30日股东户数963万户,较上期增加248%

万达电影(002739)6月30日股东户数963万户,较上期增加248%
证券之星消息,近日万达电影披露,截至2024年6月30日公司股东户数为9.63万...

亲证河水足够干净,法国体育部长塞纳河游泳迎奥运

亲证河水足够干净,法国体育部长塞纳河游泳迎奥运
法国体育、奥运会和残奥会部长阿梅莉·乌代亚-卡斯泰拉13日在塞纳河流经首都巴黎的...

华夏银行:勇担金融使命,书写2023社会责任“暖心”答卷

华夏银行:勇担金融使命,书写2023社会责任“暖心”答卷
近日,华夏银行正式发布《华夏银行股份有限公司2023年社会责任报告》(以下简称《...

坚持长期主义打胜仗,郎酒汪俊林密集调研八城百商

坚持长期主义打胜仗,郎酒汪俊林密集调研八城百商
当前,白酒行业迎来调整的新时期,新时期也孕育着新机遇。在此背景下,今年以来,不管...

日照港裕廊(06117)与日照港集团订立建筑代理合约

日照港裕廊(06117)与日照港集团订立建筑代理合约
智通财经APP讯,日照港裕廊(06117)发布公告,于2024年7月16日,公司...

中国鹏飞集团(03348HK)8月30日举行董事会会议考虑及批准中期业绩

中国鹏飞集团(03348HK)8月30日举行董事会会议考虑及批准中期业绩
格隆汇8月20日丨中国鹏飞集团(03348.HK)宣布,公司将于2024年8月3...

清远清城一男子捏造“地震”谣言,清城公安:依法处置

清远清城一男子捏造“地震”谣言,清城公安:依法处置
据“平安清城”微信公众号消息,近日,网民覃某为博取眼球、吸引流量,在某短视频平台...