跳到正文
今天10月9日周五2 条
  1. TechCrunch · AI74

    Common Sense Media称 ChatGPT for Teens存在不可接受风险,OpenAI质疑测试方法

    Common Sense Media一项研究称,ChatGPT for Teens在心理健康危机等场景中仍持续鼓励用户互动,并未充分引导与 ChatGPT 过度交流的青少年寻求成年人帮助。研究者在近2,000条提示中仅遇到两次休息提醒;OpenAI则称测试可能早于家长控制功能完成启用,并发布数据称青少年平均每天使用该服务不到15分钟。

10月8日周四
  1. Google Research74

    Google 研究 AI 辅助是否提升专业判断:133 名专利律师的三个月实验

    Google Research 对 11 家知识产权律所的 133 名律师开展为期三个月的现场实验,研究 AI 辅助对专利撰写表现和未使用工具时专业判断的影响。AI 工具使撰写评分在第 10 天提升 0.34 SD、第 90 天提升 0.38 SD;但撤除 AI 后,红线修订任务的整体优势主要来自资深律师,初级律师没有明显改善。

    推荐理由:这项为期三个月的专利撰写实验区分了 AI 提升即时产出与培养长期判断力的效果,并比较了资深与初级律师在工具撤除后的表现。

10月7日周三
  1. Latent Space63

    OpenAI 发布 722 篇数学手稿,AINews 汇总近期 AI 进展与争议

    OpenAI 发布了来自内部数学模型的 722 篇手稿,内容按 372 个结果家族整理,平均每项使用约 3 小时 ChatGPT Pro 推理计算,但相关数学结果尚未经过独立验证。Latent Space 的 AINews 还汇总了 Mistral Large 4、EmbeddingGemma 2、Nano Banana 2.1、Decisions API,以及安全评测和开发者工具等近期动态。

10月6日周二
  1. Google Research71

    Google Research 评估 Population Dynamics Foundation Model(PDFM)在全球公共卫生中的应用

    Google Research 使用 Population Dynamics Foundation Model(PDFM)的隐私保护位置嵌入,评估其在五类公共卫生任务中的表现。

    推荐理由:文章把 PDFM 放入五类公共卫生任务中比较,具体结果展示了地理嵌入在跨境免疫、疾病预测和资源规划中的可迁移价值。

10月5日周一
  1. GitHub Blog · AI & ML75

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,用于系统评估 AI 代码审查智能体。该基准参考103.9M个GitHub pull requests,包含来自187个公共开源仓库、覆盖19种语言的219个pull requests,并提供多源 golden set、分级分类标注及 grounded 和 augmented 评测指标。

    推荐理由:ReviewBench公开了覆盖219个PR和19种语言的AI代码审查评测框架,并以多源标注、统一评分和96.6%专家一致性支持系统比较。

  2. MIT Technology Review · AI36

    连接 AI 智能体与企业知识

    一项针对300名数据、AI及其他技术高管的调研显示,企业 AI 智能体项目平均仅34%进入生产环境,知识与上下文不足是主要障碍之一。生产领导者平均有61%的项目超越试点;数据碎片化是扩大知识访问最常见挑战(55%),该群体则更关注安全与隐私(72%)。

10月4日周日
  1. Hugging Face Blog81

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体评测环境

    Microsoft 与 Hugging Face 发布 ThinkingBox 及 ThinkingBox-Bench,通过终端后端状态和副作用评测 AI 智能体,并在每项任务上重复运行 20 次。

    推荐理由:文章把智能体评测从工具调用和最终回复推进到后端状态与副作用,并用20次重复揭示一次成功与持续可靠性之间的差距。

10月2日周五
10月1日周四
9月30日周三
  1. Google DeepMind77

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质加入可验证水印

    Google DeepMind 推出 SynthID Bio,可将不可感知且可验证的水印嵌入 AI 生成蛋白质的生物代码及预测结构中。在 VEGF-A、SARS-CoV-2 spike protein RBD 和 PD-L1 三种靶蛋白的湿实验中,水印设计保持了命中率、结合亲和力和自然序列多样性。

    推荐理由:文章把 AI 生成蛋白质的来源追踪与实验功能验证结合起来,具体展示了水印在序列和三维结构中的嵌入方式及三种靶蛋白上的测试结果。

9月25日周五
  1. Google Research66

    Google Research 研究如何自动生成连贯长视频

    Google Research 介绍一套基于 Gemini 和 Veo 的 AI 视频协导演示研究,通过多智能体编排视觉连续性,生成分钟级长视频并缓解视觉漂移与流水线错误传播。

    推荐理由:文章将长视频生成拆解为创意编排、视觉记忆、时序扩展和闭环优化四个框架,并给出对应基准结果,便于理解一致性问题的解决路径。

9月21日周一
9月19日周六
9月18日周五
8月24日周一
8月17日周一
7月29日周三
7月26日周日
4月20日周一
3月13日周五
1月10日周六
  1. Berkeley AI Research55

    Berkeley AI Research介绍信息驱动的成像系统设计方法

    Berkeley AI Research提出一个仅依赖含噪测量和噪声模型的框架,用互信息评估并优化成像系统的信息含量。NeurIPS 2025论文显示,该指标在彩色摄影、射电天文、无透镜成像和显微镜四个领域能够预测下游任务表现;IDEAL优化出的设计匹配端到端方法,同时需要更少内存和计算,且无需任务专用解码器设计。