1. OpenAI 发布 GPT‑6.1 Sol
事实:OpenAI 官方发布页称 GPT‑6.1 Sol 面向编码、计算机使用和专业工作,能力接近 GPT‑6 Astra;其标准 API 输入与输出 token 价格为 Astra 的五分之一。
观察:这次更新的核心不只是能力上移,而是把接近旗舰级的能力压到明显更低的单位成本,可能进一步改变高频 Agent 工作流在“旗舰模型 vs. 日常模型”之间的路由方式。
2026 年 9 月 30 日 · 北京时间即时运行版(16:43 启动)
本期是用户授权的 2026-09-30 特殊真实晚报,不覆盖同日既有 PM 演示页。优先核验过去 24 小时;个别来源仅提供发布日期或落在 72 小时回溯窗内,均按原始页面日期标注。事实与“观察”分开书写。
事实:OpenAI 官方发布页称 GPT‑6.1 Sol 面向编码、计算机使用和专业工作,能力接近 GPT‑6 Astra;其标准 API 输入与输出 token 价格为 Astra 的五分之一。
观察:这次更新的核心不只是能力上移,而是把接近旗舰级的能力压到明显更低的单位成本,可能进一步改变高频 Agent 工作流在“旗舰模型 vs. 日常模型”之间的路由方式。
事实:Anthropic 表示,在其隔离测试中,GLM‑5.3 已能端到端构建复杂漏洞利用;在 ExploitBench 的 410 次尝试中完成 50 次端到端利用。Anthropic 还报告其测试中的简单绕过方法可在 64%–100% 的情况下绕过 GLM‑5.3 的防护。上述数字均为 Anthropic 自己的测试结果,并非独立第三方结论。
观察:值得关注的是“高能力开放权重模型 + 可移除/绕过防护”的组合。对企业而言,模型安全评估可能需要从内容拒答扩展到模型权重可修改性和工具执行权限。
事实:MongoDB 发布 Atlas Agent Engine,提供 Agent 执行、记忆、检索和治理能力,现已进入 public preview。官方称其设计保持模型与框架中立,并采用 MCP、A2A 等开放标准;Runtime 与 Memory 使用按量计费。
观察:Agent 基础设施竞争正在从“框架”向生产运行层转移:持久记忆、身份、审计、治理和成本控制开始被打包成平台能力。
事实:Visual Studio 9 月更新把 Bring Your Own Model(BYOM)预览默认开放给 Community、Professional 和 Enterprise,可连接 Microsoft Foundry、OpenAI、Anthropic、Ollama,并支持 OpenAI/Ollama 自定义端点。新版 BYOM 转向基于 GitHub Copilot SDK harness 的 Agent(Preview)。
观察:IDE 正从“绑定单一 Copilot 模型”走向“Agent 外壳 + 可替换模型”。对企业开发环境而言,模型治理和自托管端点的重要性会随之上升。
事实:Microsoft 发布 Microsoft SQL Agent Skills 和 Azure SQL Developer Hub,两者均已上线且开源。Skills 覆盖 Entra 无密码连接、连接池、Schema/迁移、查询排障和向量搜索;官方明确支持 GitHub Copilot、Claude Code、Codex 与 Cursor。
观察:这是“给通用编码 Agent 补充领域操作规范”的典型路线:数据库厂商不必自己做完整 Agent,而是把经过验证的知识与操作路径做成可加载技能。
事实:NVIDIA Kumo Tabular 面向表格分类与回归,可在不针对新任务训练、调参或特征工程的情况下,通过一次前向计算完成预测。模型有 28M–215M 三种规模,使用人工生成表格预训练,并提供模型权重和 GPU 原生开源库。官方报告其在 TabArena、BeyondArena、TALENT 与 ScoringBench 上取得领先结果。
观察:表格数据仍是企业数据的主体。如果这种 in-context 表格模型在真实业务数据上保持稳定,它可能把一部分传统 AutoML 流程压缩为“上下文样本 + 直接推理”。官方也明确提醒超出训练分布时需自行验证。
事实:OpenAI 提议在继续前沿强化学习训练前建立结构化、证据驱动的 safety case,并列出对齐训练、隔离、监控、审批、暂停、审计、升级和回滚等建议。官方说明这些是当前建议,仍在实施和演进中,并非已经形成行业强制标准。
观察:这把 AI 安全治理进一步前移到“训练是否继续”的门禁,而不只是在模型发布前做评测;同时也把技术监控与组织审批放进同一套证据链。