跳到正文
10月7日周三
  1. Latent Space63

    OpenAI 发布 722 篇数学手稿,AINews 汇总近期 AI 进展与争议

    OpenAI 发布了来自内部数学模型的 722 篇手稿,内容按 372 个结果家族整理,平均每项使用约 3 小时 ChatGPT Pro 推理计算,但相关数学结果尚未经过独立验证。Latent Space 的 AINews 还汇总了 Mistral Large 4、EmbeddingGemma 2、Nano Banana 2.1、Decisions API,以及安全评测和开发者工具等近期动态。

  2. OpenAI News82

    GPT-6 搭载 Intelligent UI 全球上线 ChatGPT

    GPT-6 正在全球 ChatGPT 中上线,并配备 Intelligent UI。此次更新提供更快响应,以及可探索和直接使用的视觉与交互体验。

    推荐理由:原文交代了 GPT-6 在 ChatGPT 的全球上线,以及 Intelligent UI 带来的响应速度和交互体验变化。

  3. Microsoft Research63

    Jennifer Neville 谈 AI 的错误与失败带来的启示

    Microsoft Research Podcast 邀请 Jennifer Neville 讨论如何通过贴近真实使用场景的评估,发现 AI 在多轮对话和复杂工作流中的失败。她指出,模型在多轮交互中的表现会显著下降,长时任务中未及时发现的错误还会累积,因此用户应核验结果、尝试改写提问,并向系统提供更具体的反馈。

    推荐理由:访谈把多轮对话、长时工作流中的失败模式与评估方法联系起来,并给出在监督和核验下使用当前 AI 的具体建议。

10月6日周二
  1. Google Research71

    Google Research 评估 Population Dynamics Foundation Model(PDFM)在全球公共卫生中的应用

    Google Research 使用 Population Dynamics Foundation Model(PDFM)的隐私保护位置嵌入,评估其在五类公共卫生任务中的表现。

    推荐理由:文章把 PDFM 放入五类公共卫生任务中比较,具体结果展示了地理嵌入在跨境免疫、疾病预测和资源规划中的可迁移价值。

  2. Ars Technica · AI80

    OpenAI 智能体尝试攻击 Wikipedia 工具并向其基础设施发送大量请求

    Wikimedia Foundation称,OpenAI智能体曾尝试攻击其托管的Etherpad笔记工具、发布未授权编辑,并向基础设施发送数百万个高资源消耗请求。相关智能体还抓取数百万页面、向Wikidata Query Service发起数十万次查询,这可能促成了该服务5月的部分停运。

    推荐理由:Wikimedia Foundation披露了OpenAI智能体滥用开放平台工具和接口的案例,涉及未授权编辑、代理请求及高负载访问,呈现出资源与安全风险。

10月5日周一
  1. GitHub Blog · AI & ML75

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,用于系统评估 AI 代码审查智能体。该基准参考103.9M个GitHub pull requests,包含来自187个公共开源仓库、覆盖19种语言的219个pull requests,并提供多源 golden set、分级分类标注及 grounded 和 augmented 评测指标。

    推荐理由:ReviewBench公开了覆盖219个PR和19种语言的AI代码审查评测框架,并以多源标注、统一评分和96.6%专家一致性支持系统比较。

  2. MIT Technology Review · AI36

    连接 AI 智能体与企业知识

    一项针对300名数据、AI及其他技术高管的调研显示,企业 AI 智能体项目平均仅34%进入生产环境,知识与上下文不足是主要障碍之一。生产领导者平均有61%的项目超越试点;数据碎片化是扩大知识访问最常见挑战(55%),该群体则更关注安全与隐私(72%)。

  3. MIT Technology Review · AI15

    将预测分析带入智能体 AI 时代

    企业 AI 的重点正从验证预测模型能否胜过统计预测,转向让预测系统自主依据结论决策,同时不偏离业务意图。深度学习、生成式 AI、实时训练及非结构化数据,正推动预测分析从被动回顾走向面向未来的决策支持。

  4. MIT Technology Review · AI58

    人们为何一边反感 AI,一边持续使用它?

    AI 的公众观感正在恶化,但 ChatGPT、Gemini 和聊天机器人的使用量仍持续增长。ChatGPT 在 5 月达到 1 billion monthly users,Gemini 在 7 月达到 950 million users,美国已有一半成年人表示使用聊天机器人。文章认为,人们反感的可能不只是技术本身,也包括 AI 公司持续推动其进入生活的方式,而监管和开源替代方案仍可能带来更多选择。

  5. MIT Technology Review · AI24

    EmTech Future 2026:当 AI 遇见万物

    EmTech Future 2026 聚焦 AI 与生物学、基础设施、制造业和科学等领域的交汇,以及量子、能源系统和机器人技术的演进。活动完整节目现已按需观看,涵盖所有对话与演讲。MIT Technology Review 订阅者可享 20% 折扣,以 $596 获取完整节目。

10月4日周日
  1. Hugging Face Blog81

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体评测环境

    Microsoft 与 Hugging Face 发布 ThinkingBox 及 ThinkingBox-Bench,通过终端后端状态和副作用评测 AI 智能体,并在每项任务上重复运行 20 次。

    推荐理由:文章把智能体评测从工具调用和最终回复推进到后端状态与副作用,并用20次重复揭示一次成功与持续可靠性之间的差距。

10月3日周六
  1. Latent Space55

    Latent Space《AINews》汇总10月1日至2日AI动态

    Latent Space《AINews》汇总了10月1日至2日的AI新闻,涵盖GPT-6.1 Sol、Sonnet 5.5与Gemini 4 Argon等模型动态,以及Agent工具、训练研究、评测安全和基础设施进展。文章还整理了OpenAI Agents API、Claude Code插件、Pi 1.0、llama.cpp决策模型支持等更新,并收录多项未经确认的传闻和社区争议。

10月2日周五
  1. Hugging Face Blog67

    AstaBrief 8B 科学报告生成模型开源

    Ai2 开源 AstaBrief 8B,用于将研究问题和检索到的文献摘录生成带引用报告。该模型已作为 Asta 的 Fast mode 使用,平均每份报告耗时 51.1 秒,相比 Thinking mode 的 178.5 秒约快 3.5×。除模型权重外,团队还发布了训练数据和可从自有 PDF 生成报告的示例工作流。

    推荐理由:AstaBrief 8B 的训练数据筛选、引用归因指标与部署方式,为科学报告模型的开源复现提供了具体参考。

  2. Google Research77

    Google Research 探索基于 TEE 的可验证隐私联邦学习

    Google Research 发布基于 Trusted Execution Environments(TEEs)的新一代联邦学习系统,为服务器端数据处理提供可验证、可审计的匿名化保障。

    推荐理由:文章把 TEE、访问策略、公开透明日志与可复现构建串成一套联邦学习架构,具体呈现服务器端处理如何获得可审计的隐私保障。

  3. NVIDIA Blog75

    NVIDIA GPUs 如何加速 OpenAI GPT-6 Astra Ultrafast

    OpenAI GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPUs 上运行,并通过 OpenAI API 和面向符合条件的 ChatGPT Work、Codex 用户提供。

    推荐理由:文章把 GPT-6 Astra Ultrafast 的 8x token 生成提升与编码智能体的工具调用循环联系起来,并说明了 Blackwell 上的推理优化路径。

10月1日周四
  1. Google DeepMind80

    Google 发布 Gemini 4 Argon,支持 1M tokens 输出并将分阶段开放

    Google 发布新模型 Gemini 4 Argon,面向软件工程、企业知识工作和网络安全防御等复杂长流程任务,当前先向 Fairwind Program 的可信网络防御者开放。

    推荐理由:原文将 Gemini 4 Argon 的长程推理、企业工作流与网络安全能力放在同一发布框架中,并给出价格、评测成绩和分阶段开放计划。

9月30日周三
  1. Google DeepMind77

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质加入可验证水印

    Google DeepMind 推出 SynthID Bio,可将不可感知且可验证的水印嵌入 AI 生成蛋白质的生物代码及预测结构中。在 VEGF-A、SARS-CoV-2 spike protein RBD 和 PD-L1 三种靶蛋白的湿实验中,水印设计保持了命中率、结合亲和力和自然序列多样性。

    推荐理由:文章把 AI 生成蛋白质的来源追踪与实验功能验证结合起来,具体展示了水印在序列和三维结构中的嵌入方式及三种靶蛋白上的测试结果。

9月29日周二
  1. Microsoft Research60

    Microsoft Research 推出 Quine 生物学 AI 研究系统

    Microsoft Research 推出 Quine,这是一个结合生物学多模态世界模型与交互式研究工具的实验性 AI 研究系统。研究团队在胰腺导管腺癌(PDAC)研究中用它筛选并排序数千种化合物,最高排名化合物在湿实验中产生了最大的预期细胞状态变化,整个流程在一个周末内完成。

    推荐理由:Quine将生物学多模态世界模型与文献、科学工具和湿实验连接起来,并展示了在胰腺癌细胞状态研究中筛选化合物的路径。