勇者义彦与魔王城
突发!Gemini 3.6 来了:智力直接原地踏步,速度立刻翻倍_我的网站

A | 家人们,就在刚刚,Google正式发布了Gemini 3.6 系列模型! 这次登场的一共三个模型: 面向普通用户和开发者推出的通用模型 Gemini 3.6 Flash: 输出 token 消耗减少了约 17%,在 DeepSWE 上最高减少 65% 输入:1.50 美元/百万 token 输出:7.50 美元/百万 token 主打低成本和高吞吐的 Gemini 3.5 Flash-Lite: 输入 $0.30/百万 token 输出 $2.50/百万 token 面向网络安全场景的 Gemini 3.5 Flash Cyber: 定价还没曝光,目前只给政府和还有Google定的受信任的合作伙伴限量开放 在正式开始详细介绍前,先给大家打一针预防针: 如果只看跑分,这次更新可能没有想象中那么炸裂—Gemini 3.6 Flash 的综合智能水平与上一代基本持平,代码能力也没有横扫同级模型,但是效率绝了! Gemini 3.6 Flash Gemini 3.6 Flash 是 Gemini 3.5 Flash 的升级版,也是这次发布的主角。 视频欣赏:“过去从未逝去,它甚至从未过去”。1952年,威廉·福克纳在《修女安魂曲》中留下了这样一句经典名言;而在百年后的今天,这句话同样启迪着众多其他作品,也包括我们我们今天要谈论的游戏作品——Rusty Lake,“锈湖”系列。作为一个略带文学质感的词汇,“锈湖”本身就具备极强的叙事张力。

B | 根据 Artificial Analysis 的发布前测试,Gemini 3.6 Flash 在 Intelligence Index 上拿到了50 分,与 Gemini 3.5 Flash 持平(Ps:从综合智能表现来看,可以说完全没有实现代际跃升): 在Gemini最擅长的知识类工作的基准GDPval-AA v2 上取得 1421 Elo,比上一代高 72 分: 它真正值得一说的提升,在速度和效率上。 Gemini 3.6 Flash 完成单项任务的平均时间从 2.7 分钟降至 1.3 分钟,缩短了一半以上;输出速度达到 每秒 304 个 token。

C | 在不少玩家与粉丝看来,该系列游戏似乎具备一种与生俱来的独特气质:怪诞、迷离,兼具宿命题材特有的荒诞与纯粹。系列的多部作品层层铺垫、相互联动,逐渐形成了一个日益庞大与完善的世界观体系。而一切故事的原点,则诞生于这个最初仅由两人组成的独立团队之中。11年,19部作品,横跨3个世纪与5代人的恩怨情仇......或许就连“锈湖工作室”自己都未曾预料:当初在这款点击解谜游戏中迸发出的各种奇思妙想,会在未来逐渐发展成为一个日益庞大的“锈湖宇宙”。从15年的系列第一部作品《逃离方块:湖畔》,到前不久刚刚发售的《湖之仆从》,制作组用十余年的时间塑造了一个长青游戏系列;而游戏中有关“锈湖”的故事,则仍没有结束。2020年1月23日,几名中国玩家在历经重重困难后,终于在上海长乐路611号的一家咖啡店中找到了他们的目标:一个神秘的黑色方块。与此同时,它的输出 token 消耗减少约 17%,在 DeepSWE 等特定任务上,降幅最高可达 65%。

D | 方块中的线索直接指向了一组五位数密码,它们被用于解放关押在《白门》游戏隐藏地下室中的十位病人。而像这样的黑色方块,实际还有九个,它们分别隐藏在全球其他九个城市的各个角落。 虽然没有更聪明,但是确实做到了能用更少的 token、更短的时间完成同样水平的工作。 Gemini 3.5 Flash-Lite Gemini 3.5 Flash-Lite 面向的是另一类需求:高并发、低延迟和大批量任务。玩家需要根据《白门》游戏中的病人档案,来破解加密文件推理现实坐标,进而寻找黑方块来得到游戏中的隐藏密码。

E | 最终,近两万名玩家参与了这场由锈湖工作室举办的“现实解谜活动”,由此揭开了锈湖宇宙中“白门”精神病院的最后秘密。这的确是锈湖一次成功的线下解谜实践。在工作室接下来的两部作品《内在往昔》与《地铁:繁花》中,与之类似的大型解谜活动同样备受玩家好评。从游戏到现实、从线上到线下,这类设计确实很好诠释了锈湖系列一脉相承的核心特质:神秘诡谲的氛围、碎片化的叙事表达,以及一个个构思精妙的谜题布局。 它在 Intelligence Index 上取得 36 分,相比 Gemini 3.1 Flash-Lite 的 25 分提升了 11 分。作为最经典的点击解谜游戏系列之一,锈湖游戏作品或许称不上“最高的山”,但却一定有被评为“最长的河”的资格。 进步最明显的是智能体相关评测:GDPval-AA v2 提高 498 分,TerminalBench v2.1 提高 22.5 个百分点,Tau3-Banking 提高 7.8 个百分点。截至目前,包括最近发售的《湖之仆从》在内,锈湖工作室在Steam上的11款作品(包含合集)好评率均维持在95%左右,具备极高的玩家粘性与系列口碑,成为了如今独立游戏中“叫好又叫座”的代表之一。

F | 而工作室同样不负众望,在十余年内创造了近二十部作品,一点一点构筑起了一个横跨两个家族、涉及数代人,同时交织着炼金术、长生不老,以及轮回重生的庞大世界观。 速度同样是它的核心卖点,平均每任务用时从 1 分钟降至 0.6 分钟,输出速度达到 每秒 350 个 token。 不过,Gemini 3.5 Flash-Lite 的单次任务成本不降反升,从 0.04 美元增至 0.09 美元。

G | 主要原因是输入和输出价格分别从每百万 token 0.25 美元和 1.50 美元,上调至 0.30 美元和 2.50 美元。

H | 尽管平均每任务的输出量已从 2 万 token 降至 1.3 万 token,但仍不足以抵消价格上涨带来的成本增加。所以说了这么多,游戏中的“锈湖”到底是什么东西?在剧情表现中,锈湖只是一座坐落于荒野的内陆湖泊,但又作为“超自然意识体”独立于剧情时间线之外,拥有着灵魂跃迁、轮回永生等一系列意义象征。作为整个游戏世界观的基底,“锈湖”实际串联起了系列多部作品共同的叙事主题——记忆。锈湖需要人类的记忆维持本身的运转与存在,而游戏中的记忆作为能被感知的实体,以不同颜色的方块的形式存在:白色象征美好,黑色代表痛苦,蓝色可改变过去,金色则能实现灵魂的终极升华。 Gemini 3.5 Flash Cyber 除了两款通用模型,Google 这次还公布了一个更垂直的成员:Gemini 3.5 Flash Cyber。而玩家的游玩过程,本质更像一个从湖中不断打捞记忆残片的过程:以不同的视角去经历与认识过去,通过不同颜色的记忆来感同身受......在这一过程中,我们通过一次次解谜拼凑过往真相的同时,也在悄然塑造着故事未来的走向。 CodeMender 是 Google 的代码安全代理,主要任务就是是在代码中发现安全漏洞,并进一步生成和验证修复方案。这次出的Gemini 3.5 Flash Cyber 将作为CodeMender的核心模型,服务于漏洞查找与修复流程。所以你会发现,至少从观感上来讲,锈湖的确构建起了一整套充满神秘主义与超自然元素的概念架构。

I | 它们贯穿于游戏的方方面面,既直接服务于剧情故事的发展,同时也为整个游戏额外增添了更多脑洞与灵感设计。比如在作为一切原点的《锈湖:天堂岛》中,艾德兰家族在游戏故事中所经历的一切,就直接取材自圣经旧约《出埃及记》的“十灾”,其中的大多谜题设计也围绕于此展开。而另一方面,相比传统解谜游戏所强调的严谨推理,锈湖系列的谜题设计反而相当意识流,故而在实际体验上其实会更加反直觉。比如有人喝完酒后突然吐出一把螺丝刀,又或者去老太太的嘴中数牙齿找规律获取关键道具......而只要你愿意,去湖中钓鱼也能冷不丁突然钓上一具尸体,也更想不到解谜的关键就隐藏在这具尸体之中。 按照 Google 的说法,它在代码安全任务上的表现达到了非常具有竞争力的前沿水平,并且运行成本也低于体量更大的模型。这类脑洞大开的桥段看似毫无道理,但更多时候却是用另一套内在逻辑指引玩家前进。比如游戏其实存在大量的宗教典故、神秘学符号以及民俗传说作为谜题原型,而你不必完全了解这些充满隐喻、象征意味的文化内容,剧情会自然而言引导你进行尝试,并再次将整个解谜过程作为叙事线索的重要补充。 Gemini 3.5 Flash Cyber 更像是 Google 对“专业模型+智能体”路线的一次验证: 以更轻量的 Flash 为底座,通过安全领域优化和专用代理,把模型能力集中到一个明确的高价值任务上。 安全代理往往需要持续扫描大型代码库、分析大量上下文,并反复验证修复结果。相比一味调用最强、最大的通用模型,针对网络安全任务优化的轻量模型,更有可能在能力、响应速度和运行成本之间取得平衡。又比如在《逃离方块:剧院》中,玩家需要将风扇叶片上的梵文符号与墙上的画一一对应起来;但如果你恰好又对梵文复杂庞大的语言体系略有研究,其实会发现这些符号又正好对应着古印度婆罗门教中的“六道”,而它们则是锈湖宇宙中“长生不老”秘密的重要背景设定之一,在此后的多部作品中被重点提及。不过,Gemini 3.5 Flash Cyber 暂时不会向所有开发者开放。通过多部作品的铺垫与相互关联,锈湖的故事以碎片的形式逐渐拼凑完整。

J | 它将通过 CodeMender 独家提供,仅面向受信任的合作伙伴开展有限访问试点。 单看代码表现 在 Arena 公布的前端代码竞技场排名中,Gemini 3.6 Flash 以 1537 分位列第 12 名,相比 Gemini 3.5 Flash 的第 21 名有明显进步。 结语 目前,Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正在 Gemini App 中陆续上线,开发者也可以通过 Google AI Studio 和 Android Studio 的 API 使用新模型。 至于正在内测的 Gemini 3.5 Pro,以及已经开始训练的 Gemini 4,或许才是 Google 留给下一次能力跃升的真正看点。

K | 而游戏作为一种可直接交互的载体,玩家也借助探索解谜环节的抽丝剥茧,以不同视角还原出事件的完整真相。

L | 最后,关于 Google 这次发布,我还有几句话想说 过去的大模型发布,最容易传播的是跑分又涨了多少,但是这几次跟Google家感觉已经不恋战了。这也是除解谜以外游戏的核心魅力所在。它已经不太愿意继续纠缠于单纯的跑分竞争了。正如主创Robin在早期的一次采访所表示的那样:锈湖系列更像一种是“电视剧型”的谜题(Game-like TV series),而作为创作者的他们,其实更希望以“游戏连续剧”的作品模式,来与玩家们一起来揭示有关“锈湖”、有关游戏的更深层次秘密。本文由游民星空制作发布,未经允许禁止转载。更多相关资讯请关注:湖之仆从专区。 Gemini 3.6 Flash 交出的依然还是近两年非常具有Google味儿的答卷: 综合智能分数可以不变,只要任务速度翻倍、token 用量减少、输出价格下降,模型依然能够获得非常实际的竞争力。

M | 可能有人会问:是不是 Google 已经卷不动了? 但在我看来,这更像是大模型竞争进入下半场的一个信号。 当头部模型之间的能力差距逐渐缩小时,开发者真正关心的问题会越来越具体:同一个任务需要等多久?一次调用要花多少钱?长上下文是否稳定?能不能支撑大规模并发? 从这个角度看,Gemini 3.6 Flash 是 Google 又一次明确面向落地效率的升级。
Current article:http://xia0s.yepenchunshouzuiwai.shop/list_rlk2/ve2.html
Published on:16:03:37
