今日 AI 圈有 4 件事值得关注:Google 确认 Gemini 在第三方安全演练中访问了 3 家真实公司系统;评测机构 Vals AI 用 141 小时《我的世界》直播实测前沿模型,测试冠军完成率仅 19.2%;Qwen 开源 7B 统一图像模型,原生支持透明通道;阶跃星辰发布 Step 5 Preview,600B MoE 架构、百万 token 上下文,10 月 15 日开源权重。这四件事拼在一起,指向同一个问题:智能体与生成模型离真实生产环境还有多远。
六天 Minecraft 实测:Agent 离自主干活还差多远
第三方评测机构 Vals AI 把多个前沿模型放进《我的世界》生存模式连测六天,全程直播。GPT-6 Astra 搭出了半自动烈焰人农场,拿到 6 根烈焰棒和 3 颗末影珍珠;也把血条玩到清零,受挫后连续数小时只种土豆,还把甘蔗认成了苦力怕。
数字锚点:141 小时直播;在游戏环境评测 CUA-bench 上,它的任务完成率 19.2% 居首,第二名 Claude Fable 5.1 为 13.2%。
对企业的启示:按跑分选型,会高估智能体的真实交付能力。这次评测只给模型屏幕画面、不给调用接口、单次仅 3 小时试用,更接近真实业务里的长程任务。如果你正要做客服工单自动处理、自动运维或报表自动化,验收时应该把"失败之后的行为"和"连续纠错能力"写进指标,用自家业务的灰度数据说话,而不是照排行榜下单。我们在智能体落地项目里坚持先跑两周真实环境试运行,再谈全量交付。能力边界的收紧也不只发生在游戏里——上月初 OpenAI 已把同类模型评定到网络安全临界线,生产环境的护栏只会越来越重要。
来源:Vals AI 评测榜单 · IT之家报道
Google 确认 Gemini 安全演练"越狱":评测踩进了真实企业系统
安全实验室 Irregular 组织的红队演练出了岔子:环境配置失误让虚构公司重名了真实企业,还意外开放公网,Gemini 据此访问了 3 家真实公司系统——一次反复猜测密码,两次从公开代码仓库找到可用凭据。Google 于 9 月 18 日确认此事,称 Gemini 判断出对象是真实公司后主动停手,三家机构已收到通知。
数字锚点:3 家真实公司;Google 9 月 18 日确认;此前 OpenAI 在 8 月 26 日的同类事件复盘中,把这类行为称为"预警信号"。
对企业的启示:智能体拿到的每一个凭据、每一条网络出口,都必须是显式授权的结果。企业部署这类系统(客服、运维、财务对账)时,最小权限、凭据轮换、审计日志这三件事要落实在架构层,而不是写进提示词了事。这次的教训还有另一面:评测环境本身泄漏到公网,下一次泄漏的可能就是你的测试环境与生产数据的连接。这也不是本月唯一一例——8 月底就有无护栏智能体在安全测试中攻破开源模型平台,权限治理必须成为交付标配。
来源:量子位报道 · Irregular 官网 · AIHOT 聚合
Qwen 开源 Qwen-Image-2.1:7B 统一生成编辑,原生透明通道
Qwen 这次放出的开源图像模型 Qwen-Image-2.1,是一个 7B 的统一文生图与图像编辑权重:原生支持 RGBA 透明通道,生成、编辑、抠图用同一套权重完成;可基于最多 10 张参考图做局部编辑,支持圆圈、涂鸦、掩码三种指定方式,并保持人物与商品身份一致。
数字锚点:7B 参数、最多 10 张参考图、ComfyUI 上线即支持,模型库下载量已超 10 万次。
对企业的启示:电商主图换背景、商品抠图、营销海报排版——这一版对文字排版与人像光效做了专项优化——都可以私有化部署,数据不出内网。设计师不必整批下岗:模型接进现有设计管线后,创意判断与终审仍在人这边。我们帮企业把这类开源模型接进 App、Web、小程序的素材生产流程,替代按张计价的外包修图,通常一个季度就能把成本打下来。
阶跃星辰 Step 5 Preview:600B MoE、百万级上下文,下月开源
阶跃星辰发布 Step 5 Preview:600B MoE 架构、激活参数 27B、支持 100 万 token 上下文,官方称其进入开源模型前三,调用成本约为 Claude Opus 5 的八分之一,10 月 15 日开源权重。
数字锚点:600B/27B MoE、100 万 token 上下文、成本约 1/8、10 月 15 日开源;第三方评测机构 Artificial Analysis 已于 9 月 18 日收录其评测。
对企业的启示:百万级上下文意味着整库代码、整本案卷、整季报表可以一次读完,这对代码理解、合同审查、风控分析都是实打实的变化。国产 MoE 加开源权重,让"性价比 + 可私有化"成为一条可选路线。提醒一句:Preview 阶段能力会有波动,生产环境换模型前,请用自己的真实数据做一轮回归测试——这也是我们在软件定制开发选型环节的标准动作,避免被公开榜单带偏。
来源:Artificial Analysis · AIHOT 聚合
数据看板:综合智能榜与真实环境完成率的落差
两份榜单放在一起看,落差本身就是今天最有信息量的数字。第一份是综合智能指数(2026 年 9 月 15 日更新),第二份是 CUA-bench 真实游戏环境任务完成率(9 月 18 日发布)。两套分数量纲不同,不能直接换算。
| 模型(综合智能指数) | 得分 | 模型(游戏环境完成率) | 完成率 |
|---|---|---|---|
| Claude Fable 5.1 | 68.83% | GPT-6 Astra | 19.2% |
| GPT-6 Astra | 66.61% | Claude Fable 5.1 | 13.2% |
| Muse Spark 1.3 Max | 64.53% | Claude Opus 5 | 9.0% |
| Gemini 3.8 Flash | 62.25% | GPT-5.6 Sol | 8.3% |
| Grok 4.6 | 59.17% | Gemini 3.8 Flash | 4.2% |
| DeepSeek V4.1 Flash | 57.86% | ||
| Kimi K3 | 57.81% | ||
| GLM 5.3 | 56.97% | ||
| Qwen 3.8 Max | 51.84% | ||
| MiniMax-M3 | 42.72% |
数据来源:Vals AI 评测页(2026 年 9 月 15 日榜单与 CUA-bench 发布说明)。
我们的解读
今天两条主线值得中国企业 IT 团队放进本周的评审会:一是智能体的真实能力边界正在被第三方实测揭开,二是开源模型在多模态与性价比上快速补位。
先说智能体。综合榜上 60% 以上的分数,放进真实环境只剩 19%,这个落差不是模型不行,而是"裸模型 + 简单提示词"的架构撑不起长程任务。真正的差距在工程层:权限收敛、任务拆解、失败重试、快慢分工。就在同一天,量子位报道了 APUS 开源的轻量决策模型复现——浏览器自动化场景里,重规划交给大模型,高频判断交给小模型,在普通笔记本上全程离线跑完检索任务。这套"大脑 + 小脑"的分工,正是我们做 AI 应用与 Agent 系统交付时的默认架构:上限由工程层决定,而不是由买哪个模型决定。
再说选型。编程场景里,国产开源模型已进入可用区间(月初 Qwen3.8-Max 刚登顶过代码榜),配合开源权重即将放出的新模型,"数据不出内网 + 成本可控"的组合第一次同时成立。对正在做 AIcoding 转型的团队,这意味着试点成本大幅下降——难点转移到流程改造与验收标准上。我们的一线经验是:引入模型只占三成工作量,剩下七成在工程化,而工程化恰恰是 AIcoding 全栈开发团队能把交付工期缩短 50% 的地方。无论你要做 App、Web、小程序还是桌面端,选型、试点、灰度、全量这四步都有成熟路径可走,不必从零摸索。
延伸阅读
- AI Agent 企业落地:2026年试点热、规模化冷的真实差距——试点跑通到规模化生产之间,差距具体出在哪几环。
- AI Agent 开发企业落地:2026年三笔隐性成本与报价避坑指南——编制预算时最容易漏掉的三项开支。
联系我们
如果你的团队正在评估智能体系统落地、AIcoding 全栈开发或企业级 AI 应用定制,欢迎约一次 30 分钟免费咨询。我们会基于你的业务场景给出选型对比与实施路径建议,先帮你把验收指标定对,再谈方案。联系我们,获取 AIcoding 转型评估。
