Amazon Bedrock、AgentCore 与 Strands 九月更新盘点:GPT-6 Astra、Claude Opus 5.5、Kimi K3 等新模型上线
Amazon Bedrock 九月新增 OpenAI 的 GPT-6 Astra、Sol、Luna 系列模型,其中 GPT-6 Astra 支持最多 100 万输入 token,Ultrafast 版本 API 推理速度最高提升 6 倍、达 300 tokens/秒。
Amazon Bedrock 九月新增 OpenAI 的 GPT-6 Astra、Sol、Luna 系列模型,其中 GPT-6 Astra 支持最多 100 万输入 token,Ultrafast 版本 API 推理速度最高提升 6 倍、达 300 tokens/秒。
Postman 在 Amazon Bedrock 上构建并运行 Agent Mode,为 4000 万开发者提供覆盖 API 测试、文档、发现与实现的 AI 原生工作方式。其架构通过向量数据库将 170 多个工具按任务动态缩减到约 15 个,并采用 schema 化读取、跨区域推理与多级提示词缓存。Postman 发现工具集超过约 40 个后选择错误上升,因此将上下文而非能力视为主要瓶颈。
Sophos 使用 OpenAI 的 Daybreak 将网络威胁调查时间缩短 96%,并自动化处理 52% 的 MDR 案例,同时保留人工监督。
Asana 借助 Codex 中的 GPT-6 Astra,在测试中让浏览器智能体的模型成本降低 76 倍、速度提升 5 倍,从而为客户提供能力更强的模型。
NVIDIA 开发者正用前沿 AI 模型驱动 Omniverse 库构建仿真应用,文中示例由 GPT-6 Astra 等模型通过自然语言指令完成。Omniverse 库提供 GPU 加速的物理、渲染与传感器仿真能力,项目涵盖仓库人形机器人模拟器、自动驾驶测试工作流、数字孪生传感器校验、Unitree G1 人形机器人 Robo Olympics 以及国际空间站浏览器应用。
Incarna 借助 Amazon Bedrock AgentCore payments,让智能体通过 x402 按次向 BlockRun 支付模型推理费用,将接入 x402 支付支持的工作量从数月缩短到数天,并已把端到端按次付费推理流程投入生产。
Amazon SageMaker HyperPod 推出基于 EKS 的多租户参考架构,让多个团队共享同一 GPU 集群。该架构用 AWS IAM Identity Center 做集中认证、按团队划分 SageMaker AI 域和 Kubernetes 命名空间实现隔离,并通过 HyperPod Task Governance 做公平资源分配、命名空间级成本分摊实现按团队计费。
Oracle 在招聘、工程和运营场景中,用 ChatGPT Work 和 Codex 把专家知识转化为快速、可复用的工作流,将原本需要数天的工作缩短到几分钟。
Pollo AI 借助 GPT-5.6、GPT-6 Astra 和 GPT-Image-2.5,帮助创作者将创意转化为精细图像和电影级视频广告。
LegalOn 将 Codex 每日预估成本降低 65%,同时保持开发速度。其做法是按任务匹配 Astra、Sol 和 Luna,并对预算进行策略性管理。
OpenAI 捣毁了两起借助 AI 开展的影响力行动,这些行动利用假记者和一家智库传播地缘政治信息。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线。
推荐理由:介绍 Claude Haiku 5.5 在 Amazon Bedrock 上线及其与 Opus 5.5 的分工,可了解该模型在成本与子智能体场景中的定位。
NVIDIA 与微软在旧金山 Windows AI 与 Surface 活动上宣布为 AI 智能体共同设计 Windows PC 的软硬件,微软公布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统管控下安全持久地在后台运行。
推荐理由:英伟达与微软把智能体运行环境下沉到 Windows 与本地硬件,读者可据此判断端侧 AI 的软硬件分工走向。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 新增实时 ACL 校验层,在查询时直接向 Google Drive、SharePoint 等权威源核实权限,与原有的预检索过滤组成两阶段方案。
GitHub 与 Microsoft Applied Sciences 联合构建微调分类器,将推送保护扩展到非结构化密钥,可在不到 2 毫秒内评估整组候选密钥,有望让可拦截的密钥数量增加一倍以上。
微软研究院开源 Agent Lightning v1.0,这是一个约 3500 行代码的轻量级智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一 agent harness 直接参与训练,无需在训练框架内重新实现智能体。
推荐理由:微软开源轻量级智能体 RL 框架,用真实 harness 训练并给出 SWE-bench 提升数据,可了解训练与部署一致性的新范式。
AWS 提出 Agentic Value Model,用于替代以"节省工时×人力成本"为核心的 RPA 时代 ROI 模型,从时间节省、异常处理、决策质量、变更韧性与维护经济性四个维度衡量 agentic automation 的价值。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,为全球超 4 万名客户提供可溯源的企业级问答,自 2026 年 2 月正式可用以来,其 Discovery Agent 已为客户发现超 10 万条洞察。
OpenAI 为 ChatGPT for Teens 推出 College Planner,帮助学生管理大学申请,同时上线新的 flashcards 和 quizzes 功能,并组建青少年 AI 委员会(teen AI council)。
Radisson Hotel Group 与 Accenture 合作,基于 OpenAI 技术打造了一款 ChatGPT 插件,帮助旅客在规划行程时查找、比较和预订酒店。
微软 partner research manager Jennifer Neville 在 Microsoft Research Podcast 中讨论了评测对推动 AI 系统性能边界的作用,以及模型在超出传统 benchmark 测试时出现的"意外失败"。她指出,当结果偏离预期时应仔细审视数据,并分享了使用当前 AI 系统的实用建议。
NVIDIA 最新《State of AI in Telecommunications》报告显示,89% 受访者认为开源模型与软件对公司 AI 战略重要。NVIDIA 发布 300 亿参数的 Nemotron 3 Large Telco Model(LTM),由 AdaptKey 基于开源电信数据集微调,并公开完整微调流程。
GitHub 推出开放基准 ReviewBench,用于离线评测 AI 代码审查智能体,基于 1.039 亿个 GitHub pull request 的语言、仓库规模与变更分布构建,包含 19 种语言的 219 个公开 pull request。
NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划环节。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者;Ataraxis AI 则用病理切片预测治疗反应与复发风险。
欧央行执委 Philip R. Lane 在 2026 年欧央行货币政策会议上发表主题演讲,阐述判断合适货币政策立场面临的诊断挑战。他指出利率决策基于三项标准:通胀前景及风险、潜在通胀动态、货币政策传导力度;9 月通胀数据显示整体通胀为 3.8%,其中能源通胀 18.8%、非能源通胀 2.3%,潜在通胀指标显示中期通胀尚未出现上行。
推荐理由:欧央行执委系统拆解能源冲击、财政与AI三重力量对通胀路径的影响,并给出利率决策框架。
GitHub 提出 AI 时代开发者需要强化三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的第一次回答、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。
NVIDIA 宣布本月起由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等厂商推出 64GB 统一内存版 DGX Spark,预装 DGX OS 与 NVIDIA AI 软件栈,可本地运行最高 1000 亿参数模型。
推荐理由:NVIDIA 官方公布 DGX Spark 64GB 配置与双机集群方案,读者可据此了解本地 AI 推理的硬件门槛与扩展方式。
GPT-6 Astra Ultrafast 已在 OpenAI API 上线,并向符合条件的 ChatGPT Work 和 Codex 用户开放,运行于 NVIDIA Blackwell GPU 之上。
推荐理由:OpenAI 与 NVIDIA 联合披露 GPT-6 Astra Ultrafast 的推理加速细节,可了解模型部署后持续优化性能的路径。
美联储理事 Waller 宣布,美联储理事会发布的部分数据将接入 FRED 及其工具。FRED 目前收录超 85 万条数据序列,2025 年独立用户达 1800 万,流量正以每年 150% 增长,约一半访问来自 AI 智能体。FRED 已推出基于 MCP 的 FRED MCP Connector,让用户用自选 AI 智能体检索数据。
微软研究院开发了一套端到端机器学习流水线,利用 L1 拉格朗日点的太阳风观测数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险预测。系统结合 AE 与 Dst 指数预测、当地纬度、地质电导率和电网数据,在 2020-2026 年评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测器在 62.2% 的高活跃时段优于 Burton 方程。
美联储理事 Waller 在 Sibos 演讲中聚焦 AI 在支付领域的应用,指出 LLM 可提升制裁筛查与反洗钱准确率、大幅减少误报,并有望优化跨境支付路由与外汇兑换。他提出智能体商务存在"智能体辅助"与"智能体委托"两种模式,前者由买家决策并付款,后者由 AI 智能体自主购物支付,需更完善的信任机制与护栏。
美联储理事 Michael S. Barr 在底特律的讲话中表示,通胀已连续五年半高于 FOMC 的 2% 目标,过去 20 个月中仅两个月核心 PCE 通胀数据与 2% 相符,他尚未看到及时回到 2% 的明确趋势。
推荐理由:美联储理事在讲话中把AI对生产率与劳动力市场的影响拆成短中长期情景,并给出对政策利率路径的判断。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型与连接模型、科学工具、文献和实验的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,按驱动肿瘤细胞状态转换的潜力对数千种化合物排序,湿实验验证中排名最高的化合物产生了最大的预期状态转换,从缩小搜索空间到选出候选化合物只用了一个周末。
推荐理由:微软研究院公开 Quine 生物世界模型的设计思路与胰腺癌化合物筛选实测结果,可了解多模态世界模型在科研闭环中的落地方式。
微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向展开工作。该实验室与新加坡医疗生态伙伴合作推进多模态医疗 AI 和自演化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与运输 AI 高管圆桌会。
GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单或仪表盘等界面,无需编写代码。canvas 支持用户与 agent 同时编辑并即时同步状态,创建后可保存为扩展供团队共享或个人复用,Awesome Copilot 还提供了现成的 canvas 扩展。
GitHub Copilot 应用推出 canvas,一种运行在应用内、无浏览器外壳的全栈小应用,可与 Copilot 智能体双向通信,并能在本地执行代码、调用第三方 API。官方认为聊天只是 AI 的通用兜底界面,用户明确任务时更该让智能体生成可复用工具,而非把智能体本身当工具、反复消耗 token。SQLite 等 canvas 可一次生成,工作流自动化示例则花了近一天调优。
GitHub Security Lab 推出 Fuzzing Taskflow,一个基于 Taskflow Agent 的自主模糊测试流水线,只需指向一个 GitHub 仓库,即可自动识别入口点、编写 harness、运行 AFL++、读取覆盖率报告并生成漏洞报告。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超 100 万行改动、400 多条行内评论的开源 PR 做压力测试。其做法是把文档高度拆成确定性的代码几何与动态评论块两套体系:代码行高提前精确算出,评论高度按块懒测量、以文件和行号锚定,避免滚动跳变。
微软研究院发布针对物理 AI 机器人推理卸载的系统性研究,指出把推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软把机器人推理从机载 GPU 卸载到边缘与云端,并给出任务成功率与续航的量化对比,可据此理解物理 AI 的算力部署取舍。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重(MIT 许可),同时可通过 Microsoft Foundry 访问。
推荐理由:RetroChimera 把两种互补模型用学习式重排序集成,读者可了解逆合成预测在罕见反应与专家盲测中的表现。