跳到主要内容
博客
首页>技术博客>2026年09月23日 AI 晚报|OpenAI 组建数学家顾问组、Qwen-Image-2.1 登顶开源双榜、OpenRouter 推半价批量推理
AIcoding · Engineering Notes

2026年09月23日 AI 晚报|OpenAI 组建数学家顾问组、Qwen-Image-2.1 登顶开源双榜、OpenRouter 推半价批量推理

今日 AI 圈有 4 件值得关注的事:OpenAI 为修复学界信任成立九人独立数学顾问组 AGMAI;通义千问 Qwen-Image-2.1 在图像编辑与文生图双榜登顶开源第一,距闭源第一梯队仅 3 分;LlamaIndex 开源解析器把 PDF 文本提取压到 2.76 毫秒一页;OpenRouter 的批量推理接口以半价开放 70 多个模型。

优码云团队阅读约 9 分钟
AIAI 晚报AIcoding

今日 AI 圈有 4 件值得关注的事:OpenAI 为修复学界信任成立九人独立数学顾问组 AGMAI;通义千问 Qwen-Image-2.1 在图像编辑与文生图双榜登顶开源第一,距闭源第一梯队仅 3 分;LlamaIndex 开源解析器把 PDF 文本提取压到 2.76 毫秒一页;OpenRouter 的批量推理接口以半价开放 70 多个模型。四件事指向同一个词:确定性。

OpenAI 组建九人数学家顾问组,菲尔兹奖得主亲自澄清独立性

OpenAI 于周一宣布成立独立数学顾问组 AGMAI(数学与人工智能顾问组,官网 agmai.org):九名成员来自斯坦福、哈佛、牛津与剑桥,含多位菲尔兹奖与麦克阿瑟奖得主,由普林斯顿高等研究院提供技术与传播支持。菲尔兹奖得主 Martin Hairer 随后在陶哲轩博客发表客座文章澄清:小组独立于 OpenAI 及任何前沿实验室——并非所有成员最初都由 OpenAI 联系,成员不领取报酬,除保密要求外未签任何限制公开表态的文件,宗旨是尽可能代表数学社群的利益。

时间锚点:顾问组宣布于 9 月 22 日;Hairer 的第一手说明发布于北京时间 9 月 23 日清晨。

背景是 AI 数学成果引发的学界信任危机。9 月 6 日,Epoch AI 发布 FrontierMath Erdős 基准:68 道当时仍开放的 Erdős 数论问题,要求 AI 在 Lean 证明助手中完成证明或证伪,每题 300 美元算力预算——GPT-6 Astra 得分 3%,其余 5 个受测 AI 全部为 0%。9 月 15 日,arXiv 上又出现对 GPT-6 Astra 所证 Erdős–Sós 猜想证明的阐述版论文。今晚,Epoch AI 研究员将两篇论文提交 Hacker News,讨论仍在进行。

对企业的启示:对企业团队,AGMAI 的价值不在八卦,而在机制设计——独立成员、不领薪、可公开评论、由第三方研究院托管,这是一套典型的"可验证性治理"。企业把 Agent 系统接进业务流程时,同样需要这种独立复核节点:模型产出先过规则引擎或人工抽检,关键决策留痕可审计。优码云在为企业定制 Agent 系统时,把复核与审计做成流程的一等公民,而不是事后补丁——这是 AI 应用能否过合规与验收的关键分水岭。

来源:Hairer 客座文(陶哲轩博客)|博客文章公开元数据|HN 讨论元数据

Qwen-Image-2.1 登顶图像双榜开源第一

通义千问开源图像模型 Qwen-Image-2.1(代码仓库定位为"Qwen 最强开源图像生成模型",仓库于 9 月 18 日创建)公布榜单结果:在 Image Edit Arena 得 1367 分,位列开源第一、总榜第 16,距第 15 名 GPT-Image-1.5-high-fidelity 仅 3 分;同时拿下文生图榜开源第一。

时间锚点:榜单结果于 9 月 23 日公布,榜单官方与通义千问官方账号均确认。

对企业的启示:图像编辑与生成正从"能看"转向"能用"——商品图批量重绘、营销物料多语言本地化、运营素材流水线,考验的都是一致性。开源模型与闭源的差距缩到 3 分,意味着企业可以零授权成本自建图像生产管线,并把模型私有化部署进内网,数据不出域。优码云给零售与电商客户做 AI 应用定制时,多模态选型已优先评估"开源底座 + 定制微调"的组合:授权成本归零、微调数据留企内、交付后按业务节奏自主升级。

来源:代码仓库元数据|aihot 转述榜单结果

LiteParse 月度更新:PDF 解析进入毫秒时代

LlamaIndex 官方开源文档解析器发布 9 月更新(版本号 2.14.6):基于自维护 PDFium 分支与 mimalloc 内存分配优化,文本提取 2.76 毫秒一页、Markdown 渲染 3.94 毫秒一页,整体提速 20-25%;新增视觉定位接口(模型可回溯引用在页面上的坐标)与 is-complex 路由接口(按文档复杂度自动分流解析管线)。

时间锚点:更新发布于北京时间 9 月 22 日 22:38,由官方博客与代码仓库同步确认。

对企业的启示:RAG 与知识库项目的第一公里是文档解析。这次更新的两个接口正对企业刚需:视觉定位让"AI 的答案源自第几页第几块"可审计——这在合同审查、投标文件、财报问答里是合规硬要求;is-complex 路由让简单文档走便宜管线、复杂文档走重管线,平均成本可控。优码云在承接企业 AI 应用与软件定制开发项目时,解析层的吞吐与可溯源性直接决定项目验收——毫秒级解析意味着十万页级文档库可以在普通服务器上当晚跑完,而不是买一个月的算力。

来源:代码仓库元数据|aihot 转述官方博客

OpenRouter 批量推理接口:价格直接对折

模型聚合平台 OpenRouter 上线批量推理接口:请求打包成异步任务,供应商在 24 小时窗口内择时完成,价格普遍为常规每 token 价格的一半(有时更低),覆盖 70 多个模型,支持对话补全、messages 与 embedding 等端点形状。两周测试期共完成超过 23 万个任务批次:中位完成时间 7 分钟,90% 在 1 小时内。

时间锚点:官方公告于 9 月 22 日发布,北京时间 9 月 23 日凌晨经 Hacker News 社区转发扩散。

对企业的启示:不是所有推理都要实时。语料标注、embedding 回填、评测集打分、工单积压摘要、整夜跑几千行同一提示——这些离线负载从实时通道挪到批量通道,成本直接砍半,且端点形状与实时接口一致,业务几乎不用重构;单条结果独立返回,个别坏行不拖垮整批。优码云给客户做 Agent 系统与 AI 应用的成本工程时,"实时走流式、离线走批量"是标准双通道设计——这次等于直接有了现成的对折通道,报表生成与知识库重建这类夜间任务率先受益。

来源:OpenRouter 官方公告|HN 讨论元数据

今日工程效率看板

指标数值说明
Qwen-Image-2.1 图像编辑榜1367 分开源第一、总榜第 16
与总榜第 15 名差距3 分对象为 GPT-Image-1.5-high-fidelity
文档解析文本提取2.76 毫秒/页2.14.6 版,整体提速 20-25%
文档解析 Markdown 渲染3.94 毫秒/页同上
批量推理折扣约 50%部分模型更低,覆盖 70+ 模型
批量任务中位完成时间7 分钟23 万+ 批次,90% 在 1 小时内

我们的解读

今天没有"又一个更大的模型",四件事全部指向同一个工程主题——确定性。数学家顾问组把"AI 的数学成果可信吗"变成制度问题;Lean 形式化验证把证明变成机器可查的代码;毫秒级解析把文档吞吐的账摆上台面;批量接口把推理成本写成对折的账。企业 AI 落地正在从"演示效果"转向"可验证、可核算、可审计"。

这正是优码云在深圳与大湾区客户项目里的日常:AIcoding 全栈开发不是让模型写两行代码的演示,而是把 Agent 系统、文档管线、批量任务放进有复核节点、有成本台账的工程体系。工期缩短 50% 的来源是工程化,不是玄学——解析快 20-25%,知识库重建当晚完成;推理半价,报表与标注任务敢跑了;开源模型追平闭源,授权预算归零。App、Web、小程序、桌面端无论哪条产品线,先把"可验证"设计进去,之后每一次模型降价与开源追平(比如今天榜单上的 3 分差距)都会自动变成你的利润。

延伸阅读

联系我们

如果你的团队正想把 Agent 系统、文档智能或批量任务管线落进业务,优码云提供 30 分钟免费咨询与 AIcoding 转型评估:从选型、架构到交付验收的完整方案,App、Web、小程序、桌面端全栈覆盖。欢迎通过联系我们预约。

分享到
AI 晚报 9.23|数学家顾问组、Qwen 登… - 优码云博客