GPT-4o一夜被赶超!Anthropic推出Claude 3.5,网友3分钟克隆马里奥游戏公众号新闻2024-06-21 13:06OpenAI劲敌出手,追击GPT-4o。编译 | 李水青编辑 | 心缘一夜之间,刚封神的GPT-4o被赶超了。智东西6月21日报道,昨日晚间,Anthropic推出了新一代大模型Claude 3.5 Sonnet,在多项全球权威测评中一举超越了OpenAI的GPT-4o。Claude 3.5 Sonnet不仅超过其已发最强模型Claude 3 Opus,在研究生水平的推理 (GPQA)、本科生水平的知识 (MMLU) 和编码能力 (HumanEval)多方面,也都刷新了行业基准。在速度和成本方面,Claude 3.5 Sonnet是Claude 3 Opus的两倍,加上优惠的价格,它很适合帮用户处理编程、联动程序等复杂任务。目前,用户可以通过Claude网页和iOS程序免费试用Claude 3.5 Sonnet,付费用户能更高速访问。同时,客户可通过Anthropic API、Amazon Bedrock和Google Cloud获取该模型。API的收费标准是3美元/每百万输入tokens,15美元/每百万输出tokens,支持200k tokens上下文窗口。发布之后,Claude 3.5 Sonnet立马在AI圈引起轰动。有网友称,使用Claude 3.5 Sonnet编程比GPT-4o效率高10倍。有网友3分钟完成了马里奥游戏的克隆版,称最疯狂的是基于最新Artifacs预览功能,一键看到编程应用的预览效果。Anthropic被视为OpenAI最有力的竞争对手之一,本次Claude 3.5 Sonnet的发布可谓狙击GPT-4o。这是其Claude 3.5的中杯版本,Claude 3.5 Haiku和Claude 3.5 Opus计划今年晚些时候推出。有一个有意思的细节,在Anthropic的演示视频中出现的演示用户是“Sam”,这似乎是在问候OpenAI的CEO Sam Altman。官方地址:https://claude.ai/01.生成2倍速,多项能力赶超GPT-4oClaude 3.5 Sonnet在其公布的GPQA、MMLU、HumanEval等所有测评中,都超越了OpenAI的GPT-4o,仅数学能力得分略低于GPT-4o。在AI搜索引擎创企Perplexity的试用评估中,Claude 3.5也获得了优于GPT-4o的表现。Claude 3.5 Sonnet现已在付费AI搜索引擎Perplexity Pro上推出。在社交媒体X,不少第三方测评团队也给出了试用结论,相比于GPT-4o,Claude 3.5 Sonnet几乎成了推理、语言、编程、数据分析、数学和指令遵循方面的“六边形战士”。Claude 3.5 Sonnet不仅超过其已发最强模型Claude 3 Opus,在速度和成本方面,Claude 3.5 Sonnet也与Anthropic的中端型号Claude 3 Sonnet旗鼓相当——运行速度是Claude 3 Opus的两倍,成本仅1/5。在内部代理编码评估中,Claude 3.5 Sonnet成功解决了64%的问题,表现优于仅解决了38%的Claude 3 Opus。在得到指导和相关工具后,Claude 3.5 Sonnet 能够独立编写、编辑和执行代码,并具备复杂的推理和故障排除能力。有网友在社交平台X贴出使用体验,仅仅25秒,Claude 3.5 Sonnet帮他编写了一个功能整齐的游戏程序。02.最强视觉模型,多测评超GPT-4o,图表识别能力炸场Claude 3.5 Sonnet也是Anthropic目前最强大的视觉模型。它在标准视觉基准测试中超越了Claude 3 Opus。对于需要视觉推理的任务,如解释图表和图形,这些改进尤为显著。此外,Claude 3.5 Sonnet还能准确地从质量不高的图像中转录文本。如下图所示,在多项权威测评中Claude 3.5 Sonnet超过了GPT-4o,在所有测评中超越了Gemini 1.5 Pro。如下图所示,Claude 3.5 Sonnet可以快速识别PDF文件内容并输出折线图。当被继续要求生成网页演示内容,Claude 3.5 Sonnet也可以胜任。03.颠覆对话式协作,交互升级,四步编程并渲染游戏现在,Anthropic还将在Claude.ai上推出Artifacts这一新功能,相当于一个预览功能,用以丰富用户与Claude的互动方式。当用户请求Claude生成代码片段、文本文档或网站设计等内容时,这些Artifacts将在一个专用窗口中与对话一同展示。这为用户提供了一个动态工作区,他们可以实时查看、编辑和构建Claude的创作,将AI生成的内容融入自己的项目和工作流程中。这一功能的推出标志着Claude从对话式AI向协作式工作环境的进化。如下图所示,如果要搭建一款游戏并预览效果,用户进需要四个步骤。首先,输入文本让Claude 3.5 Sonnet生成一个特定大小和风格的角色。然后,让Claude 3.5 Sonnet为类似风格的视觉要素编程。紧接着,一个整体的游戏页面被搭建出来,用户可以随时看到代码的生成过程。最后,就连游戏运行起来的效果,用户也可以通过Artifacts模式进行预览。在社交媒体X上,有网友称“这太疯狂了”,认为工件+渲染窗口是最佳的编码方式。作为Anthropic对安全和透明度的承诺,Anthropic最近已将Claude 3.5 Sonnet提供给英国人工智能安全研究所(UK AISI)进行部署前的安全评估,并与美国人工智能安全研究所(US AISI)分享了结果。Anthropic称其模型开发的核心原则之一是保护隐私。除非用户明确允许,否则Anthropic不会使用用户提交的数据来训练生成模型。Anthropic称其到目前为止未使用任何用户数据来训练生成模型。04.结语:OpenAI劲敌出手,追击GPT-4oAnthropic被认为是OpenAI最强竞争对手之一,Claude 3.5 Sonnet是Claude 3.5系列首款产品,今年晚些时候推出的Claude 3.5 Haiku和Claude 3.5 Opus,是等待OpenAI的后招。除了研发下一代模型系列,Anthropic还在开发支持企业应用的功能和模式,包括与企业应用程序的集成。Anthropic的团队还在探索诸如“记忆”这样的功能,让Claude能够记住用户的偏好和特定的交互历史,从而提供更加个性化和高效的用户体验。(本文系网易新闻•网易号特色内容激励计划签约账号【智东西】原创内容,未经账号授权,禁止随意转载。)微信扫码关注该文公众号作者戳这里提交新闻线索和高质量文章给我们。来源: qq点击查看作者最近其他文章