今日 AI 圈有 4 件事值得关注:DeepSeek 发布开源多模态模型 V4.1 Flash 并大幅调价,9 月 14 日起旧旗舰请求将全量切换至新价格;Anthropic CEO 阿莫迪发文呼吁给前沿模型增速踩刹车,马斯克与阿尔特曼隔空响应;Google 开源的设备自动化项目被 Minitap 公开追讨代码署名;海外推理平台 Baseten 则宣布上线 V4.1 Flash,为中国开源模型铺出海外部署通道。四条消息分别关系到企业的成本表、技术预期与合规清单,逐条拆解如下。
DeepSeek V4.1 Flash 开源降价,9 月 14 日起旧旗舰全量切换
9 月 10 日,DeepSeek 发布多模态模型 V4.1 Flash 并开源权重。新模型采用 552B 总参数的 CED(因果编码-解码)非对称架构,输入侧激活参数仅 8B;配合 KV Cache 压缩,显存占用降至原来的四分之一、SSD 需求降至八分之一。价格同步调整:空闲时段每百万 token 输入未命中 1 元、输出 4 元,高峰时段翻倍,缓存命中输入低至 0.02 元、较旧版下降 60%。更重要的是 9 月 14 日 12:00 起,发往 deepseek-v4-pro 的请求将全部路由到这款新模型并按其单价计费,直至下一代旗舰上线。
这次调价真正改变的是智能体应用的成本模型。以客户支持、长文档审阅、代码评审这类高频调用场景为例,输入价格进入"1 元档"后,过去算不过账的规模化功能值得重算一遍 ROI。正在使用旧旗舰的团队要注意:切换无需改代码,但务必提前跑一轮回归评测——官方基准中新模型在多项智能体评测上得分更高,在 GPQA Diamond 这类知识型项目上与更旗舰的闭源模型仍有差距,业务敏感场景需要实测。另外,腾讯旗下 WorkBuddy、CodeBuddy 等开发工具已全量接入,AIcoding 工具链的价格水位整体下探,对做 AI 应用与智能体系统的团队是实打实的成本利好。
信源:第一财经报道(东方财富转载);官方公告全文另见新浪财经转载;海外推理平台 Baseten 的上线公告亦确认了模型定位与细节。
阿莫迪发文呼吁给前沿 AI"踩刹车",马斯克与阿尔特曼响应
9 月 12 日,Anthropic CEO 达里奥·阿莫迪发表长文,主张前沿实验室把模型能力增速减半,用换来的时间补齐对齐与安全——放缓不等于停滞,而是把争取到的 1-2 年窗口投入工程标准、安全合规训练、内部机理探查与更严格的评测基准。英国《金融时报》报道称,阿尔特曼与马斯克均对此作出正面回应,马斯克的表态是"Dario is right"(达里奥说得对);彭博社亦在本周报道,OpenAI 正考虑放缓尖端开发速度。这不是孤立的表态:此前 7 月,来自各前沿实验室的 1386 名员工已联署同类倡议,OpenAI、Anthropic、Google DeepMind、Meta 的多位首席科学家出现在联名名单中。
这条新闻的价值在于"窗口期"判断:如果头部实验室在安全与监管约束下放缓能力增速,未来一两年各家可用模型的差距会趋于收敛,竞争重心将进一步转向工程落地——谁能把现有模型嵌进业务流程、把数据管线与评测体系搭好,谁就拿红利。对计划启动 AIcoding 转型的企业,这是一个明确信号:不必等"更强的模型",现在就该用现有模型重构开发流程。优码云在与客户共建智能体系统时也采用同样的排序:先立评测与数据底座,再谈模型选型。
出处:Pacing the Frontier 联署官网(含完整联名名单);IT之家:Anthropic CEO 阿莫迪称 AI 行业应当放缓发展速度(腾讯新闻)。
Google 开源的 Artemis 被 Minitap 公开追讨署名
9 月 11 日,开源项目 mobile-use 背后的公司 Minitap 发文称,Google 开源的移动设备自动化项目 Artemis 中存在与其代码完全一致的实现——连接 Android 设备的模块一致,名为 Hopper 的智能体指令逐字相同,连示例任务(给同三位联系人发新年祝福)都一样;早期包文件里三位 Minitap 成员的署名,在 8 月的一次强推中被替换成另一位作者。mobile-use 采用 Apache 2.0 许可证,其第 4 条明确要求再分发时保留版权与署名声明、并标注修改。据 IT之家援引外媒报道,谷歌其后已在仓库说明中补上"包含由 Minitap 开发的源代码"的标注。
这件事最值得技术团队记住的不是争议本身,而是许可条款"长牙"的方式:Apache 2.0 并非"随便用",署名与修改标注是硬性义务。企业把开源组件纳入软件定制开发交付物时,应当把许可证合规检查做进 CI 流程——尤其是把开源代码改写后放进闭源产品的场景。Minitap 已公开代码比对与时间线存档并联系 Google,事件以补署名暂告一段落;对正在构建智能体应用的企业,这也是一次提醒:供应链里每一行代码的来源都应当可追溯。
参考:Minitap 官方声明(含代码比对细节与完整时间线);IT之家:开源项目 Minitap 指控谷歌盗用自家代码(新浪财经)。
Baseten 上线 V4.1 Flash 推理:中国开源模型铺出海外通道
9 月 11 日,海外推理平台 Baseten 宣布在其 Model APIs 上线这款国产新模型,支持百万级长上下文与 OpenAI 兼容接口;其官方更新日志同步给出调用示例,模型定位为"面向智能体与编程工作流",内置推理与工具调用。Unite.AI 于同日跟进报道:该模型为 552B 总参数的多模态混合专家架构,输入侧激活仅 8B。
对做出海 AI 应用或需要海外节点的团队,这是一条现成的部署通道:不必自建 GPU 集群,通过 OpenAI 兼容接口就能把模型嵌进现有系统,官方定价为输入 0.3 美元、输出 1.2 美元(均按百万单位计)。对国内团队,这同样意味着"开源权重 + 第三方推理平台"的组合正在成为跨区域交付的常规选项。企业可以把"模型可替换性"写进架构设计——同一套智能体系统,国内走官方 API、海外走 Baseten 这类平台,成本与合规各自最优,评测与提示词资产则保持一套。
资料来源:Baseten 官方更新日志;Unite.AI:Baseten Adds DeepSeek-V4.1-Flash to Model APIs。
数据看板:V4.1 Flash 定价速览
| 计费项 | 空闲时段 | 高峰时段 |
|---|---|---|
| 输入(缓存命中) | 0.02 元/百万 | 0.04 元/百万 |
| 输入(缓存未命中) | 1 元/百万 | 2 元/百万 |
| 输出 | 4 元/百万 | 8 元/百万 |
注:以上为该模型公开定价(计量单位:每百万 tokens),9 月 10 日 12:00 起生效;9 月 14 日 12:00 起,deepseek-v4-pro 的请求全部按上表计费。
我们的解读
把今天的四条新闻放在一起,指向同一个判断:行业竞争正从"模型军备竞赛"转向"落地效率竞赛"。DeepSeek 把旗舰级多模态能力的价格打到"1 元档",Baseten 们迅速把中国开源模型接进全球推理网络;阿莫迪的减速呼吁,则给"模型能力持续指数级跃升"的预期第一次画上问号。OpenAI 同期还披露了其存储底座 Habitat 的数据——每秒 7000 万次请求、规模同比增长超 10 倍,Rust 重写后 CPU 效率提升 6 倍(据 daily.dev 与 LLM Rumors 的工程分析)——供给侧的消息几乎都是"更便宜、更快、更可控"。
这对中国企业意味着什么?三点。第一,推理与微调成本下探,让过去"算不过账"的场景——客户支持、文档审阅、代码评审、跨系统数据搬运——现在可以用软件定制开发的方式整体重建,ROI 请按新价格重算。第二,如果前沿增速放缓,模型间的差距会收敛,真正的护城河在工程与数据:评测集、私有知识管线、权限与审计——智能体应用真正的瓶颈往往不在模型,而在会话状态、多模态缓存这些数据层设计上。第三,开源合规要进入交付流程,Artemis 之争就是前车之鉴。优码云的 AIcoding 全栈开发方法把需求到上线的周期压缩约一半,覆盖 App、Web、小程序与桌面端;在智能体系统落地项目里,我们坚持先建数据层与评测、再放大模型调用量——今天这几条新闻,正是这套方法论的注脚。
本周还有一条动态值得留意:OpenAI 已把全双工语音模型 GPT-Live-1 开放进 API,支持边听边说与任务委派(首发于 9 月 10 日);Together AI 亦于 9 月 11 日扩展微调服务,把多家国产模型与海外开源权重的微调收进统一控制台(官方博客),托管微调正在变成中小企业的标配选项。
延伸阅读
- AI Agent 工程化 · 桌面端实战指南:智能体从原型到生产级的工程化路径。
- 客户案例库:AI 应用与智能体系统的行业落地实例。
- 技术博客:AIcoding、全栈开发与工程实践持续更新。
联系我们
如果你的团队正在评估新旗舰迁移、智能体系统落地或 AIcoding 转型,优码云提供 30 分钟免费咨询与转型评估:从场景盘点、成本测算到架构选型,输出一份可直接执行的路线图。欢迎访问联系我们页面预约。
