跳到正文
10月7日周三
  1. Latent Space

    OpenAI 内部模型发布 722 篇数学论文,称解决 500 个公开难题中的 90 个

    OpenAI 从一个未公开的内部前沿模型发布了一批数学成果,公开在 GitHub 仓库中,包含 722 篇手稿、分为 372 个相关结果族,来自约 4000 个研究问题的评测,每个结果平均消耗约 3 小时 ChatGPT Pro 推理算力,模型本身仍未发布。

    推荐理由:汇总 OpenAI 内部数学模型的发布规模与算力成本,并附数学家与质疑者的分歧,便于判断这批结果的可信边界。

10月6日周二
10月5日周一
  1. MIT Technology Review · AI

    从预测到自主决策:预测分析如何进入智能体 AI 时代

    企业 AI 的竞争焦点已从预测模型能否超越统计预测,转向如何让预测系统在不偏离业务意图的前提下自主行动。深度学习与生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而无需等待季度刷新,其数据来源也从规整的数值记录扩展到非结构化交互数据。Everest Group 合伙人 Vishal Gupta 认为,"分析"一词正在让位于 AI。

  2. NVIDIA Blog

    NVIDIA Inception 初创公司如何用 AI 补齐乳腺癌诊疗缺口

    NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划环节。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者;Ataraxis AI 则用病理切片预测治疗反应与复发风险。

  3. MIT Technology Review · AI

    人们一边痛恨 AI,一边又离不开它,这是为什么?

    调查显示公众对 AI 的负面情绪持续升温:Pew 数据显示更多美国成年人认为 AI 对个人和社会的影响偏负面,Gallup 5 月民调中 71% 美国成年人反对在本地新建 AI 数据中心,而 ChatGPT 在 5 月月活用户突破 10 亿,Gemini 7 月达 9.5 亿。作者认为,人们厌恶的并非技术本身,而是科技公司不遗余力将 AI 推向各处的做法。

  4. 欧央行·新闻

    欧央行执委 Lane:能源冲击、财政与 AI 下的货币政策诊断挑战

    欧央行执委 Philip R. Lane 在 2026 年欧央行货币政策会议上发表主题演讲,阐述判断合适货币政策立场面临的诊断挑战。他指出利率决策基于三项标准:通胀前景及风险、潜在通胀动态、货币政策传导力度;9 月通胀数据显示整体通胀为 3.8%,其中能源通胀 18.8%、非能源通胀 2.3%,潜在通胀指标显示中期通胀尚未出现上行。

    推荐理由:欧央行执委系统拆解能源冲击、财政与AI三重力量对通胀路径的影响,并给出利率决策框架。

10月3日周六
10月2日周五
  1. GitHub Blog · AI & ML

    AI 正在改变开发者工作方式,GitHub 给出三项需要强化的技能

    GitHub 提出 AI 时代开发者需要强化三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的第一次回答、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。

10月1日周四
  1. Microsoft Research

    微软研究院用机器学习预测电网空间天气风险,覆盖美国 66,935 座变电站

    微软研究院开发了一套端到端机器学习流水线,利用 L1 拉格朗日点的太阳风观测数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险预测。系统结合 AE 与 Dst 指数预测、当地纬度、地质电导率和电网数据,在 2020-2026 年评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测器在 62.2% 的高活跃时段优于 Burton 方程。

9月30日周三
  1. 美联储·官员讲话

    美联储 Waller:AI 智能体时代的支付系统与智能体商务

    美联储理事 Waller 在 Sibos 演讲中聚焦 AI 在支付领域的应用,指出 LLM 可提升制裁筛查与反洗钱准确率、大幅减少误报,并有望优化跨境支付路由与外汇兑换。他提出智能体商务存在"智能体辅助"与"智能体委托"两种模式,前者由买家决策并付款,后者由 AI 智能体自主购物支付,需更完善的信任机制与护栏。

  2. 美联储·官员讲话

    美联储理事 Barr 谈经济状况与货币政策:通胀仍过高,AI 影响存在多重情景

    美联储理事 Michael S. Barr 在底特律的讲话中表示,通胀已连续五年半高于 FOMC 的 2% 目标,过去 20 个月中仅两个月核心 PCE 通胀数据与 2% 相符,他尚未看到及时回到 2% 的明确趋势。

    推荐理由:美联储理事在讲话中把AI对生产率与劳动力市场的影响拆成短中长期情景,并给出对政策利率路径的判断。

9月29日周二
  1. Microsoft Research

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型与连接模型、科学工具、文献和实验的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,按驱动肿瘤细胞状态转换的潜力对数千种化合物排序,湿实验验证中排名最高的化合物产生了最大的预期状态转换,从缩小搜索空间到选出候选化合物只用了一个周末。

    推荐理由:微软研究院公开 Quine 生物世界模型的设计思路与胰腺癌化合物筛选实测结果,可了解多模态世界模型在科研闭环中的落地方式。

  2. Microsoft Research

    微软亚洲研究院新加坡分院成立一周年:推进前沿 AI 研究、合作与人才培养

    微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向展开工作。该实验室与新加坡医疗生态伙伴合作推进多模态医疗 AI 和自演化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与运输 AI 高管圆桌会。

9月26日周六
  1. GitHub Blog · AI & ML

    GitHub Copilot 应用入门:如何用 canvases 构建自定义工作流

    GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单或仪表盘等界面,无需编写代码。canvas 支持用户与 agent 同时编辑并即时同步状态,创建后可保存为扩展供团队共享或个人复用,Awesome Copilot 还提供了现成的 canvas 扩展。

9月25日周五
  1. GitHub Blog · AI & ML

    GitHub Copilot 的 canvas:当聊天不再是正确的 AI 交互界面

    GitHub Copilot 应用推出 canvas,一种运行在应用内、无浏览器外壳的全栈小应用,可与 Copilot 智能体双向通信,并能在本地执行代码、调用第三方 API。官方认为聊天只是 AI 的通用兜底界面,用户明确任务时更该让智能体生成可复用工具,而非把智能体本身当工具、反复消耗 token。SQLite 等 canvas 可一次生成,工作流自动化示例则花了近一天调优。

9月24日周四
  1. GitHub Blog · AI & ML

    GitHub Copilot 应用如何渲染超大 pull request

    GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超 100 万行改动、400 多条行内评论的开源 PR 做压力测试。其做法是把文档高度拆成确定性的代码几何与动态评论块两套体系:代码行高提前精确算出,评论高度按块懒测量、以文件和行号锚定,避免滚动跳变。

  2. Microsoft Research

    微软研究:将物理 AI 推理卸载到边缘与云端可提升机器人表现与续航

    微软研究院发布针对物理 AI 机器人推理卸载的系统性研究,指出把推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软把机器人推理从机载 GPU 卸载到边缘与云端,并给出任务成功率与续航的量化对比,可据此理解物理 AI 的算力部署取舍。

9月21日周一
9月18日周五
  1. GitHub Blog · AI & ML

    GitHub Podcast 拆解 AI 热门观点:该不该读 AI 生成的代码、RAG 是否已死、Skills 是否杀死了 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分配;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准,二者可组合使用;RAG 并未消亡,它让模型基于训练数据外的文档、内部知识或代码库上下文作答,减少 token 浪费和不完整回答。

9月1日周二
7月29日周三
7月26日周日
  1. Berkeley AI Research

    伯克利提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    伯克利 AI 研究提出 ABBEL 框架,将 LLM 的递归摘要隔离为自然语言"信念状态"并对其内容进行监督评分。在 CollabBench 协作编程任务中,基于重建的信念评分(rec-BG)将模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 长度也显著低于全上下文设置。

7月14日周二
  1. 美联储·国会证词

    美联储主席 Warsh 首次国会证词:维持利率 3.5%–3.75% 并设立五个政策评估小组

    美联储主席 Warsh 在首次半年度货币政策报告国会证词中表示,6 月会议决定将联邦基金利率目标区间维持在 3-1/2 至 3-3/4 个百分点,并强调委员会对持续高通胀零容忍、致力于恢复价格稳定。

    推荐理由:新任美联储主席首次国会证词,交代利率按兵不动与五个内部评估小组的方向,可据此观察政策框架的调整线索。

7月7日周二
7月1日周三
  1. Berkeley AI Research

    2026 BAIR 研究生展示:伯克利 AI 博士毕业生去向一览

    伯克利人工智能研究实验室(BAIR)公布 2026 届博士毕业生名单及其研究方向与去向,涵盖机器人、大语言模型推理、计算机视觉、生成模型、AI 安全与人机交互等领域。毕业生将赴 OpenAI、Mistral AI、Amazon、Physical Intelligence 等机构任研究岗,或进入 UCLA、普林斯顿 CITP、芝加哥大学等学术界。

5月8日周五
4月20日周一
  1. Berkeley AI Research

    GRASP:面向世界模型长时程规划的梯度规划器

    伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得可行。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型梯度脆弱等问题。

3月26日周四
  1. 美联储·国会证词

    美联储理事 Guynn 就银行业 AI、数字资产与银行-金融科技合作作证

    美联储监管副主席 Guynn 在国会证词中表示,受监管银行对 AI 的使用近年显著增长,生成式 AI 与 agentic AI 正推动行业探索,目前多限于文档摘要、编码辅助等低风险场景。美联储正推动监管透明化,已公开监管运营原则及大型银行监管手册,并聚焦 AI、数字资产和银行-金融科技合作三大领域。

3月13日周五