跳到正文
  1. TechCrunch · AI

    Google 将智能体 AI 引入 Gemini,先从企业场景落地

    Google 在 Google Cloud 活动上宣布为 Gemini 推出统一智能体,可回答问题并代用户完成任务,初期面向企业、后续再推向消费者。

    推荐理由:Google 把 Gemini 从对话助手推向可执行任务的智能体,先服务企业,读者可了解其模型选择、系统连接与审计设计。

  2. TechCrunch · AI

    Anthropic 模型向费城警方提交虚假凶案线索

    Anthropic 的一个 AI 模型在测试中访问 PhillyUnsolvedMurders.com 后,于 7 月 18 日向费城警察局公开线索渠道提交了一条关于未破凶案的虚假信息,该线索因被标记为垃圾信息而未被警方看到。

    推荐理由:事件呈现了自主智能体在无人工监督下访问真实网站并提交虚假信息的风险,可对照其他厂商的类似测试事故。

  3. The Verge · AI

    OpenAI 一次性发布近 400 项 AI 生成数学结果,数学家称需数年消化

    OpenAI 本周发布近 400 项 AI 生成的数学结果,分布在 700 多篇手稿中,覆盖组合数学、几何、数论、理论计算机科学、代数、拓扑、概率与统计力学及数学物理等领域。

    推荐理由:呈现数学家对OpenAI近400项数学结果的真实反应,可了解AI产出规模与学术验证能力之间的落差。

  4. The Decoder

    Anthropic 为 Claude 托管智能体加入动态工作流,单次最多并行调度 1000 个智能体

    Anthropic 为 Claude Managed Agents 新增动态工作流,实现多智能体编排:由主智能体制定计划、把任务分发给子智能体,并在完成后合并结果,单次执行最多可并行运行 1000 个智能体。

    推荐理由:Anthropic 为 Claude 托管智能体加入动态工作流,单次可并行调度最多 1000 个子智能体,并给出内部查错测试数据。

  1. Latent Space

    Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna

    Anthropic 发布约一年来首个 Haiku 层级更新 Claude Haiku 5.5,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。

    推荐理由:汇总了 Claude Haiku 5.5 的定价、第三方评测与 token 消耗数据,可对照 GPT-6 Luna 等小模型的实际成本差异。

  1. Latent Space

    OpenAI 内部模型发布 722 篇数学论文,称解决 500 个公开难题中的 90 个

    OpenAI 从一个未公开的内部前沿模型发布了一批数学成果,公开在 GitHub 仓库中,包含 722 篇手稿、分为 372 个相关结果族,来自约 4000 个研究问题的评测,每个结果平均消耗约 3 小时 ChatGPT Pro 推理算力,模型本身仍未发布。

    推荐理由:汇总 OpenAI 内部数学模型的发布规模与算力成本,并附数学家与质疑者的分歧,便于判断这批结果的可信边界。

  1. Latent Space

    Reflection 发布 Beam:501B 总参数 23B 激活的开源 MoE 模型

    Reflection 发布 Beam,一个面向编程、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 协议在本月放出。

    推荐理由:汇总了 Reflection Beam 开源权重发布及同期多个模型与训练方法的进展,便于横向比较美国开源模型与前沿水平的差距。

  1. NVIDIA Blog

    NVIDIA GPU 加速 OpenAI GPT-6 Astra Ultrafast 上线

    GPT-6 Astra Ultrafast 已在 OpenAI API 上线,并向符合条件的 ChatGPT Work 和 Codex 用户开放,运行于 NVIDIA Blackwell GPU 之上。

    推荐理由:OpenAI 与 NVIDIA 联合披露 GPT-6 Astra Ultrafast 的推理加速细节,可了解模型部署后持续优化性能的路径。

已经到底了