新闻中心
你的位置:开云网页注册登录人口(中国)股份有限公司 > 新闻中心 > 开yun体育网Claude Opus 4.1 成为施展最好的模子-开云网页注册登录人口(中国)股份有限公司

开yun体育网Claude Opus 4.1 成为施展最好的模子-开云网页注册登录人口(中国)股份有限公司

时间:2026-09-05 05:27 点击:134 次

开yun体育网Claude Opus 4.1 成为施展最好的模子-开云网页注册登录人口(中国)股份有限公司

OpenAI 发布最新权术,却在内部夸了一波 Claude。

他们提倡名为GDPval的新基准,用来估计 AI 模子在确切宇宙具有经济价值的任务上的施展。

具体来说,GDPval 消逝了对好意思国 GDP 孝顺最大的 9 个行业中的 44 种作事,这些作事年均创收整个达 3 万亿好意思元。任务基于平均领有 14 年教训的行业众人的代表性责任假想而成。

专科评分东谈主员将主流模子的输出完了与东谈主类众人的遵守进行了对比。

最终测试下来,Claude Opus 4.1 成为施展最好的模子,47.6% 的产出被评定忘形东谈主类众人遵守。

GPT-5 38.8% 的获利和 Claude 如故有些差距,位居第二;GPT-4o 与东谈主类比拟只消 12.4% 成功或平局。

没能成为最优,OpenAI 也给我方找补了:不同模子各有上风,Claude Opus 4.1 主如果在好意思学方面凸起,而GPT-5 在准确性上更优。

OpenAI 还默示,相似值得防护的是模子的逾越速率,其前沿模子在短短一年内,胜率险些完结了翻倍。

临了 OpenAI 还开源了包含 220 项任务的优质子集,并提供公开的自动评分服务。

网友看后纷纷默示,相称因吹斯汀的权术:

OpenAI 各代模子的性能呈线性增长,以及感谢对竞争敌手的招供。

还有网友认为,这也可能是奥特曼悉心假想的宣传妙技,通过吹嘘 AI 能为 GDP 带来增长而筹集资金。

底下具体来看一下这项测试。

测试 AI 的"挣钱"智商

OpenAI 指出,GDPval 比拟现存的 AI 评估,好就好在:

任务基于确切责任遵守且关联完成时代与本钱,具备推行性;

涵盖 O*NET(好意思国作事信息网罗)跟踪的大部分作事责任行为,具有代表性广度;

任务条目处理多种体式文献并知道多个参考文献,波及狡计机使用与多模态;

除了正确性还需琢磨结构、立场等主不雅身分,数据集也可手脚评估自动评分系统性能的测试平台;

以胜率为主要谋划无上限,撑握握续评估;

任务难度高,行业专科东谈主士平均需 7 小时完成,复杂任务致使耗时数周。

其任务构建经过,最初从细目中枢行业与作事发轫。

OpenAI 先是筛选出了对好意思国 GDP 孝顺超 5% 的 9 个行业(依据 2024 年第二季度各行业增多值占好意思国国内坐蓐总值百分比数据),再在每个行业内挑选 5 个孝顺工资总数最多且以数字任务为主的作事。

判断作事是否"以数字任务为主"时,参考 ONET 中该作事的系数任务,借助 GPT-4o 对任务按"数字 / 非数字"分类,勾通 ONET 中任务的联系性、垂死性和频率得分加权狡计,若 60% 以上任务为数字任务,则将该作事纳入。

最终 OpenAI 筛选出了 44 个作事,这些作事整个年创收 3 万亿好意思元。

接着进行行业专科东谈主士招募,条目参与任务创建的众人至少有 4 年联系作事教训,简历需体现专科招供度、晋升经验及责罚职责。

经统计,招募来的行业众人平均教训达 14 年。

这些东谈主还需进一步通过视频口试、布景打听、培训及测试能力参与该模式(OpenAI 还会给到一笔优越报酬),其前老板涵盖苹果、谷歌、微软、Meta、三星、甲骨文、IBM、摩根大通等繁密知名企业与机构,确保众人具备塌实的行业实行基础。

任务创建体式,每个 GDPval 任务包含"需求"和"请托遵守"两部分,行业众人会对照 O*NET 中本人作事的任务分类假想任务,以保证任务消逝的广度与代表性。

为了评估任务质地,OpenAI 条目这些众人字据其作事的内容范例,对每项任务的难度、代表性、完成时代和举座质地等进行打分,并勾通 OEWS(好意思国劳工统计局作事作事统计)数据中对应作事的中位时薪,通过"平均完成时代 × 时薪"狡计每个任务的经济价值。

最终,GDPval 全皆集总共包含 1320 项任务,系数任务均经过了"自动化模子筛选 + 多轮东谈主类众人审核"的迭代经过,每个任务会取得至少 3 次、平均 5 次的东谈主工审核。

众人在各评审阶段会给出翔实观念。任务会字据观念反复修改完善。

Claude 施展忘形东谈主类众人

OpenAI 开源了包含 220 项任务的优质子集,遴选了盲态众人 pairwise 对比法(即众人不透露待评遵守开端的成对对比评分方式),对该子集进行评级。

每项对比评分平均耗时特出 1 小时。OpenAI 默示还相当邀请了更多作事领域众人,对东谈主类众人与模子输出的遵守进行评分。众人需为其聘请及排序完了提供翔实依据。

针对优质子集,OpenAI 同期开垦了实验性自动评分器,其与东谈主类众人评分的一致性达 66%,仅比东谈主类间评分一致性(71%)低 5%。

对 GPT-4o、o4-mini、o3、GPT-5、Claude Opus 4.1、Gemini 2.5 Pro 及 Grok 4 这几款模子进行评估后,完了深远:

在 GDPval 优质子集任务中,Claude Opus 4.1 是举座施展最好的模子,尤其在好意思不雅性方面(如文档体式、幻灯片布局)施展凸起。

其输出的遵守中,有 47.6% 被评定为优于或等同于东谈主类众人水平的遵守。

OpenAI 各代模子在 GDPval 上的施展简短呈线性提高。

而字据下图所示,GPT-5 在准确性方面(如严格解任指示、完成正确狡计)上风显耀。

换句话说,GPT-5 在纯文本任务上施展更优,但 Claude 在 .pdf、.xlsx、.ppt 等文献类型的处理上施展更佳,展现出更强的视觉感知与好意思不雅假想智商。

在 GDPval 优质子集的一谈任务中,有略多于 50% 的任务里,至少有一个模子的输出遵守优于东谈主类众人或与东谈主类众人迥殊。

OpenAI 还指出,将 AI 模子与东谈主类监督勾通,在完成任务时有望比单独东谈主类众人更经济高效。

不管是"先让模子试作念,不赋闲再我方改"的模式,如故"平直用模子遵守""只让模子试一次就我方作念"等模式,都能帮东谈主类从简本钱和时代。

此外,权术发现增多推理神勇(如对 o3、GPT-5 确立不同推理强度)、提供更多任务布景、优化教导词与智能体援助框架(如通过在容器中撑握 GET 恳求,遴选" N=4 "的"最优 N 选 1 "抽样政策,搭配 GPT-5 手脚判断模子)能显耀提高模子性能。

OpenAI 也指出了 GDPval 的局限性,如数据集范围有限(仅 44 种作事)、聚焦可在狡计机上完成的学问责任(不包含膂力处事等)、任务为精确指定的一次性任务(缺少交互性)、自动评分器存在不及、评估本钱高档。

当今,GDPval 尚处于初步阶段,OpenAI 策划在将来的迭代版块中,渐渐拓展其消逝范围、增强确切性与交互性,并纳入更多场景细节。

By the way,不光 OpenAI 以为 Claude 好,已经的亲密盟友微软最近传来音问:联袂 Anthropic 优化 Microsoft 365 Copilot AI 助手(doge)。

参考流畅:

[ 1 ] https://x.com/OpenAI/status/1971249374077518226

[ 2 ] https://evals.openai.com/

一键三连「点赞」「转发」「严防心」

接待在评述区留住你的念念法!

—  完  —

� �  量子位智库 AI100 季度榜单征皆集!征围聚果 10 月 10 日。接待提名 2025 年 Q3「AI 100」双榜单产物~ 

一键眷注 � � 点亮星标

科技前沿进展逐日见开yun体育网

回到顶部
服务热线
官方网站:www.newart-dg.com
工作时间:周一至周六(09:00-18:00)
联系我们
QQ:27590794398
邮箱:87c20418@outlook.com
地址:新闻中心科技园7556号
关注公众号

Powered by 开云网页注册登录人口(中国)股份有限公司 RSS地图 HTML地图


开云网页注册登录人口(中国)股份有限公司-开yun体育网Claude Opus 4.1 成为施展最好的模子-开云网页注册登录人口(中国)股份有限公司