今日 AI 圈有 7 件值得关注的事:英伟达单季营收冲到 962 亿美元,同比增 106%;亚马逊再追加 200 万颗 GPU 订单;Anthropic 把自家助手放进 Chrome 向所有付费用户开放;智谱 GLM 与阿里 Qwen 同日开源。算力、浏览器 Agent、开源模型三条线同时提速,企业 AI 应用落地的成本门槛正在肉眼可见地下降。
英伟达 Q2 营收 962 亿美元:AI 算力需求没有减速
英伟达 2027 财年第二财季财报超预期:营收 962.21 亿美元,同比增 106%、环比增 18%;归母净利润 596.88 亿美元,同比增 126%;数据中心收入 890.23 亿美元,同比增 117%;GAAP 毛利率 75%。Vera Rubin 平台已进入全面量产,公司给出 2028 财年约 70% 的营收增长指引,财报盘后股价一度涨超 5%。
财报于美东 8 月 26 日盘后(北京时间 8 月 27 日凌晨)发布。
对企业而言,这条数据的含义是算力仍在快速扩张,但交付重心正从“抢卡”转向“用好卡”。当头部云厂商和创业公司都在消化百万级 GPU 时,自建集群的门槛反而更高了;对软件定制开发团队来说,更现实的做法是把 AIcoding 用在调用层和业务层的效率提升上——把重复工程环节自动化,把预算留给真正差异化的 AI 应用功能。
[来源] 英伟达 2027 财年半年报(AIHOT 聚合) · 英伟达财报前瞻(华盛通)
亚马逊追加 200 万颗 GPU:云厂商算力订单进入“百万颗”量级
亚马逊与英伟达宣布扩大合作,将在 2027 和 2028 年为 AWS 数据中心新增约 200 万颗 GPU,覆盖 Blackwell Ultra、Rubin 与 Rubin Ultra 三代产品。此前五个月亚马逊刚同意部署超 100 万颗英伟达 GPU,英伟达称此后“需求超出预期”。
8 月 26 日官宣;双方未披露财务条款,按 GPU 单价估算交易价值达数百亿美元。
云厂商连续追加百万颗级订单,说明 AI 推理与智能体类负载的真实用量在爆发,而不是停留在演示阶段。对于正在规划 AI 应用的企业,这意味着“模型调用”会长期保持卖方市场,把核心业务逻辑做薄、把智能体编排掌握在自己手里,比依赖单一算力渠道更抗风险。
Claude in Chrome 全面开放:浏览器智能体进入免审批自主执行阶段
Anthropic 宣布 Claude in Chrome 面向所有付费套餐全面开放。该助手可在浏览器中观察页面并自主执行操作,无需逐步审批;系统在每次操作前用安全分类器验证操作安全性及是否符合用户请求,并强化了提示注入攻击防御。
8 月 26 日官宣;评测显示,启用探测与安全分类器后,自 Opus 4.8 起所有模型均未出现安全事件。
浏览器 Agent 从“演示”走向“默认能力”,意味着大量表单填写、数据整理、跨系统搬运的重复工作可以被自动化。对做客户服务或运营系统的团队,这提示了下一轮 AI 应用的方向:与其开发独立爬虫,不如让智能体在浏览器这个通用接口上直接替用户完成任务。
[来源] Claude in Chrome 全面开放(AIHOT 聚合)
智谱 GLM-5.3-Flash 开放:原生多模态 + 激活参数 18B
智谱发布并开放首个原生多模态模型 GLM-5.3-Flash:总参数 320B、每 token 激活 18B,采用稀疏注意力与线性注意力混合架构,注意力计算量降低 3.01 倍、KV 缓存降低 4.44 倍;GLM Coding Plan 全面放开,额度提升至 3 倍,定价约为 GLM-5.3 的 1/10。
8 月 26 日发布。
混合架构加低激活参数,是开源模型降本的主流路径。对 AIcoding 团队来说,这类模型意味着把代码生成、视觉理解塞进生产流水线的成本继续下降;做全栈开发交付时,多模态能力也可以直接用于 UI 还原、页面截图验收等环节。
[来源] 智谱官方文档
阿里 Qwen3.8-Flash 开放:Qwen4 架构预览,训练成本降至前代 1/9
通义千问发布并开放 Qwen3.8-Flash:主参 125B、每 token 激活 6B,训练成本仅为 Qwen3.7-Plus 的 1/9;原生 262K 上下文可扩展至 1M;API 定价 1 元 / 百万输入 token、3 元 / 百万输出 token;权重于 8 月 26 日 23:00 在 Hugging Face 与 ModelScope 开放。
权重当日开放。
该模型的 Next 架构被视为 Qwen4 的雏形,6B 激活参数使它在普通服务器上就能跑出接近头部闭源模型的水平。对中小企业来说,这是把 AI 应用从“API 调用”升级为“私有化部署”的窗口期——模型体积变小,软件定制开发的空间反而变大。
[来源] 阿里千问新模型发布(雷峰网) · 新浪科技报道
Gemini 3.5 Transcribe 上线:语音转写从“逐字记录”走向“理解式转写”
谷歌发布语音转文本模型 Gemini 3.5 Transcribe:能识别说话人的自我修正、自动删除口头禅,把非结构化口语直接整理为格式化文本;支持 85 种以上语言、多语言混说、自定义词汇、说话人识别与逐词时间戳,文件转录最长 1 小时。
当地时间 8 月 26 日发布,已进入 Android 版 Gboard、Mac 版 Gemini 应用,并通过 Gemini API 开放预览;与 Gemini 3.5 Live 等同日构成 Gemini Audio 系列。
语音入口正在从“识别”升级为“理解”。对做会议纪要、客服质检、医疗记录等系统的团队,直接用这类理解式转写,可以省掉一层后处理管道;在 AI 应用里接入语音交互,也到了体验上“足够可用”的阶段。
Anthropic 开放 25 万段真实对话数据:把模型行为放到独立研究里
Anthropic 通过隐私保护工具 Insights(原 Clio)向斯坦福大学 SALT Lab、牛津大学人类信息处理实验室及 METR 三个外部机构开放约 25 万段 2026 年 4-5 月的 Claude.ai 与 Claude Code 对话数据,供其独立设计研究并公开发布结果。
8 月 26 日公布试点结果。
头部模型厂商愿意把真实使用数据交给第三方审计,说明“可验证、可审计”正在成为 AI 平台竞争的加分项。对企业选型而言,这也是一个信号:选择模型或智能体平台时,把供应商的透明度与数据治理能力列入评估维度,能显著降低长期绑定风险。
[来源] Anthropic 开放对话数据供独立研究(AIHOT 聚合)
数据看板:同日发布的两款轻量模型怎么选
| 对比项 | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|
| 总参数量 | 320B | 125B(另含 51B 嵌入) |
| 每 token 激活 | 18B | 6B |
| 架构特色 | 稀疏 + 线性注意力混合 | Qwen4 架构预览(MoE) |
| 原生上下文 | 官方暂未披露 | 262K,可扩展至 1M |
| 训练成本 | — | 约为 Qwen3.7-Plus 的 1/9 |
| API 定价 | 约为 GLM-5.3 的 1/10 | 1 元 / 百万输入、3 元 / 百万输出 |
| 权重开放 | 是 | 是(当日) |
两款模型都走“低激活参数 + 可私有化”的轻量部署路线。选型时重点看两件事:你的场景是否需要多模态(GLM 原生支持),以及你的上下文与吞吐需求(Qwen 的 262K 原生上下文更长)。
我们的解读
今天 7 条新闻放在一起,主线很清楚:算力在涨、模型在变便宜、智能体在进入浏览器。对计划做 AI 转型的中国企业来说,这三点指向同一个结论——AI 应用开发的瓶颈已经不在模型能力,而在工程化交付能力。英伟达季度收入逼近千亿美元、模型价格打到 1/10,说明调用成本不再是主要矛盾;这类浏览器智能体的成熟,则把“自动化”从概念变成了随时可用的基础设施。真正拉开差距的,是谁能把模型、智能体与业务系统焊接到一起。优码云团队把这些能力沉淀为 AIcoding 全栈开发方法论:从 App、Web、小程序到桌面端,用 AI 编程工具把需求到上线的工期缩短约 50%,并在需要时为企业定制智能体系统与软件定制开发方案。今天最值得做的动作,不是抢算力,而是挑一个真实业务场景,用低成本开源模型或现成智能体快速验证,再交给专业团队做全栈落地。
延伸阅读
- AICoding 落地实战:跨平台选型与团队转型指南
- 移动端 AIcoding 落地:三类方案选型对比
- AICoding 落地:桌面端团队能力建设实战指南
- 往期早报:2026年08月16日|SpaceX 完成六百亿美元收购、Anthropic 公开文本水印细节
- 往期早报:2026年08月19日|Stripe 70 亿美元收购 OpenRouter、蚂蚁集团发布全栈智能体底座
联系我们
如果今天的新闻让你开始盘算 AI 应用改造,欢迎预约 30 分钟免费咨询:我们结合 AIcoding 方法论,帮你的团队做一次转型评估,输出可执行的落地方案。联系优码云。
