九游游戏大全汇聚海量热门手游与精品力作,玩家可通过九游官网及九游网页版直接进入,无需下载,即点即玩,畅享高效便捷的游戏体验。九游游戏平台界面友好、更新及时,覆盖多种类型玩法,满足不同玩家喜好,是广大用户首选的游戏聚合入口。

在九游官网方面,九游游戏大全提供贴心周到的支持。

九游游戏大全专注智能推荐引擎根据玩家偏好精准匹配游戏,提升发现效率。,为用户提供专业可靠的体验。

谷歌终于祭出了重磅武器!全能型选手Gemini 4 Pro实测结果随后奉上。

过去半年间,大模型排行榜不断洗牌:GPT-6(Astra)与Fable相继将竞争焦点转向代码、Agent及长程任务领域,而谷歌却长期处于被动挨打局面。

Flash系列以挤牙膏式节奏更新,真正代表旗舰实力的Pro版本却迟迟未能换代。值得注意的是,距离Gemini 3.1 Pro发布,已整整过去7个月。

原定于6月亮相的Gemini 3.5 Pro一再推迟。有报道称,Google当时仍在持续强化其Coding能力,延期已在内部广泛引发对团队迭代速度的担忧。到了7月财报会上,Google索性提前亮出底牌,劈叉哥宣布,公司早已启动Gemini 4“迄今最雄心勃勃的预训练”。

9月18日消息,谷歌跳过Gemini 3系列的小版本更新,直接推出Gemini 4。昨夜,多位开发者在Arena的匿名Battle Mode中抽到了一个名为gemini-3.8-flash的模型。问题在于,真正的Gemini 3.8 Flash早在9月2日就已正式发布,并已进入Arena公开榜单。

同一个名字,为何又突然出现在匿名测试中?更反常的是,这个“3.8 Flash”展现出的能力远超公开版本。

很快,LuminaBench、Harshith、Qwinah等长期追踪前沿模型的测试者随后陆续将其指向Google正在测试的Gemini 4 Pro checkpoint,内部代号被曝为“Argon”。

Qwinah还通过超长JSON压力测试称,该模型能够持续输出至接近256K规模。当然,这些参数目前仍属于社区测试结果,尚未得到Google确认。

但真正将这轮讨论的预期值拉满的,还是随后流出的Arena盲测榜单。

13项全能碾压Astra和Fable

根据这份Benchmark对比数据,Gemini 4 Pro在表中列出的13组测试里全部取得最高成绩,对手包括GPT-6 Astra、Claude Fable 5.1、Claude Opus 5和GPT-5.6 Sol。

最直观的Coding测试DeepSWE v1.1中,Gemini 4 Pro拿到88.7%,超过Astra的86.9%;

考察真实知识工作的GDPval-AA v2,达到2064 Elo,同样超过Astra的1994;

HLE多学科专家推理,达到72.1%,领先Astra近5个百分点。

而在任务越复杂、链路越长的情况下,Gemini 4 Pro表现出的优势更加明显。

在Terminal-Bench 2.1中,它与自家Gemini 4 Flash只有3.2个百分点差距;换到更考验通用Agent长程执行的Terminal-Bench 4.0,差距直接扩大到13.9个百分点。

类似情况还出现在OSWorld 2.0。Gemini 4 Pro达到86.8%,Gemini 4 Flash为74.9%,拉开11.9个百分点;DeepSWE、HLE以及BioMystery高难任务中,Pro相比Flash也分别领先8.3、8.3和8.3个百分点。

这意味着Gemini 4 Pro的能力提升集中于Agent长程任务,在任务持续时间拉长、步骤增加、需要不断读取状态并重新规划时,性能衰减得更慢。

这恰恰是当前Agent真正卡脖子的地方。DeepSWE本身就是专门为长程软件工程任务设计的测试,需要模型在真实代码库中持续修改和验证;OSWorld 2.0则把Agent扔进真实电脑环境,108项任务中近七成需要人类一小时以上完成,平均需要数百步操作。

Terminal-Bench团队自己总结过,现有Agent最典型的问题,就是难以持续串联多步动作、维护长上下文,并在缺乏人工干预的情况下自主完成复杂工作。

近五分之一的价格

Gemini 4 Pro的价格可能比跑分更凶。

榜单显示,Gemini 4 Pro价格只有每百万Token输入2.25美元、输出11.25美元,而Astra分别达到12美元和60美元。也就是说,Google不是用更贵的旗舰换来了领先,而是以约五分之一的Token价格打出了更高的成绩。

如果这一价格真正落地,势必将拉低A社和OpenAI的价格:旗舰模型的竞争,开始从“谁最强”变成“谁能让最强能力便宜到可以大规模跑Agent”。

当然,目前这张成绩表尚未得到官方认领,还需辩证看待。

以DeepSWE为例,其公开Leaderboard当前Astra成绩约为74.1%,Gemini 3.8 Flash约73.8%,与流出表中的数值口径存在差异,意味着后者可能使用了不同Agent harness、推理配置,或者来自尚未公开的新一轮测试。

实测惊艳

当前,Arena已经跑出了密集测试。比较惊艳的是网页设计。

开发者让Gemini 4 Pro制作一个专题网站,模型最终只用了14分钟,就完成了从页面结构、视觉风格到交互效果的一整套设计。测试者评价:网站“干净、精致”,甚至感叹,早期Gemini模型长期被吐槽的“设计品味”问题,似乎终于解决了。

另一个经典测试,则是“鹈鹕骑自行车”。开发者Harshith表示只给出一句要求:尽可能漂亮地用SVG画一只骑自行车的鹈鹕。Gemini 4 Pro就能用代码完成整幅动态场景,鹈鹕、车轮、骑行动作和背景关系都保持得相当完整。

这类任务难点不只是写SVG,而是要同时处理代码、空间关系和视觉构图。社区随后拿公开版Gemini 3.8 Flash跑同一提示词,成品差距相当明显(可见开篇对比视频)。

第三类测试从“画图”升级到真正的3D交互。

Voxel Pagoda测试中,Gemini 4 Pro大约花5分钟搭出一座可交互的像素风3D宝塔;另一项PS5 SVG测试甚至连续运行约10分钟,不仅细节入微,更展现了模型在持续规划和生成,把复杂成品一次做完的能力。

有关Gemini 4 Pro的更多技术细节和评测数据,可通过九游官网获取最新动态。本文来自微信公众号 “AI前线”(ID:ai-front),作者:四月,36氪经授权发布。

想了解更多海量正版手游聚合,覆盖角色扮演、策略、休闲、模拟经营等全品类玩法。相关内容,尽在九游游戏大全。