Common Sense Media称 ChatGPT for Teens存在不可接受风险,OpenAI质疑测试方法
Common Sense Media一项研究称,ChatGPT for Teens在心理健康危机等场景中仍持续鼓励用户互动,并未充分引导与 ChatGPT 过度交流的青少年寻求成年人帮助。研究者在近2,000条提示中仅遇到两次休息提醒;OpenAI则称测试可能早于家长控制功能完成启用,并发布数据称青少年平均每天使用该服务不到15分钟。
Common Sense Media一项研究称,ChatGPT for Teens在心理健康危机等场景中仍持续鼓励用户互动,并未充分引导与 ChatGPT 过度交流的青少年寻求成年人帮助。研究者在近2,000条提示中仅遇到两次休息提醒;OpenAI则称测试可能早于家长控制功能完成启用,并发布数据称青少年平均每天使用该服务不到15分钟。
Anthropic 的 Claude Science 利用 AI agents 下载、校准并合并多项太空任务数据,绘制了完整的天空紫外线地图。项目使用 inpainting 补齐缺失区域,测试中预测结果与实际测量的平均偏差约为 10%。这张地图计划作为教学材料。
Google Research 对 11 家知识产权律所的 133 名律师开展为期三个月的现场实验,研究 AI 辅助对专利撰写表现和未使用工具时专业判断的影响。AI 工具使撰写评分在第 10 天提升 0.34 SD、第 90 天提升 0.38 SD;但撤除 AI 后,红线修订任务的整体优势主要来自资深律师,初级律师没有明显改善。
推荐理由:这项为期三个月的专利撰写实验区分了 AI 提升即时产出与培养长期判断力的效果,并比较了资深与初级律师在工具撤除后的表现。
Nemotron 团队从 Nemotron 3 出发,结合 SFT、RL 和反馈驱动推理,在 IOI 2026 得到 535.4/600,在 IMO 2026 得到 30/42,均达到金牌级门槛。
推荐理由:文章对比了 Nemotron 在 IOI 与 IMO 中的专门化路径,具体展示微调、反馈推理和验证流程如何协同提升竞赛表现。
OpenAI 发布了来自内部数学模型的 722 篇手稿,内容按 372 个结果家族整理,平均每项使用约 3 小时 ChatGPT Pro 推理计算,但相关数学结果尚未经过独立验证。Latent Space 的 AINews 还汇总了 Mistral Large 4、EmbeddingGemma 2、Nano Banana 2.1、Decisions API,以及安全评测和开发者工具等近期动态。
Google Research 使用 Population Dynamics Foundation Model(PDFM)的隐私保护位置嵌入,评估其在五类公共卫生任务中的表现。
推荐理由:文章把 PDFM 放入五类公共卫生任务中比较,具体结果展示了地理嵌入在跨境免疫、疾病预测和资源规划中的可迁移价值。
Google Research 发布《智能体隐私与安全中的开放及新兴问题:情境视角》研讨会报告,汇集50多位学术界和产业界参与者,分析自主智能体在隐私与安全方面面临的基础挑战。
GitHub 发布 ReviewBench,用于系统评估 AI 代码审查智能体。该基准参考103.9M个GitHub pull requests,包含来自187个公共开源仓库、覆盖19种语言的219个pull requests,并提供多源 golden set、分级分类标注及 grounded 和 augmented 评测指标。
推荐理由:ReviewBench公开了覆盖219个PR和19种语言的AI代码审查评测框架,并以多源标注、统一评分和96.6%专家一致性支持系统比较。
一项针对300名数据、AI及其他技术高管的调研显示,企业 AI 智能体项目平均仅34%进入生产环境,知识与上下文不足是主要障碍之一。生产领导者平均有61%的项目超越试点;数据碎片化是扩大知识访问最常见挑战(55%),该群体则更关注安全与隐私(72%)。
Microsoft 与 Hugging Face 发布 ThinkingBox 及 ThinkingBox-Bench,通过终端后端状态和副作用评测 AI 智能体,并在每项任务上重复运行 20 次。
推荐理由:文章把智能体评测从工具调用和最终回复推进到后端状态与副作用,并用20次重复揭示一次成功与持续可靠性之间的差距。
ServiceNow CoreAI 构建 AutoSynthData,根据目标模型的失败和教师模型的成功生成、验证面向企业环境的智能体训练任务。任务由系统规范、用户提示和验证器组成,并经过可执行性、正负验证及批量覆盖检查。
Microsoft Research 开发了一套机器学习流程,为美国本土 66,935 座变电站生成空间天气风险预测。系统结合太阳风信息、AE 和 Dst 预测、当地地质条件及电网数据,可提前 30-60 分钟估计具体地点的风险。
Google DeepMind 推出 SynthID Bio,可将不可感知且可验证的水印嵌入 AI 生成蛋白质的生物代码及预测结构中。在 VEGF-A、SARS-CoV-2 spike protein RBD 和 PD-L1 三种靶蛋白的湿实验中,水印设计保持了命中率、结合亲和力和自然序列多样性。
推荐理由:文章把 AI 生成蛋白质的来源追踪与实验功能验证结合起来,具体展示了水印在序列和三维结构中的嵌入方式及三种靶蛋白上的测试结果。
Hugging Face 发布 Open TTS Leaderboard,使用 WER/CER、RTFx、TTFA 和说话人相似度等客观指标评测开放式、多语言 TTS 模型。
推荐理由:Hugging Face 将多语言、语音克隆、推理速度与流式延迟纳入统一评测,为开放 TTS 模型提供更可扩展的比较维度。
Diffusion Controller 将 AI 图像生成的完整去噪过程重构为连续控制问题,用轻量级附加网络动态调整生成轨迹,在保持基础模型稳定性与图像质量的同时对齐用户偏好。
Google Research 介绍一套基于 Gemini 和 Veo 的 AI 视频协导演示研究,通过多智能体编排视觉连续性,生成分钟级长视频并缓解视觉漂移与流水线错误传播。
推荐理由:文章将长视频生成拆解为创意编排、视觉记忆、时序扩展和闭环优化四个框架,并给出对应基准结果,便于理解一致性问题的解决路径。
Microsoft Research 在 Nature 发表 RetroChimera 逆合成模型研究,并开源其实现与权重。RetroChimera 结合 Transformer 模型 R-SMILES 2 与基于 GNN 的 NeuralLoc,通过学习重排序整合两者预测;在包含十个挑战性目标的专家评估中,它完成了其中九个目标的路线规划。
Import AI 第473期梳理了 RAND 关于美国在通往超智能路径上保留战略选择的报告,并介绍了人类皮层类器官移植到小鼠、AI 进展节奏研究、未审查模型生态和递归自我改进(RSI)动力学。
Google Research推出 MilleMiglia,一款用 C++ 编写、用于生成中程物流逼真基准实例的生成器。它通过空间—时间图上的多商品流模型,捕捉跨配送中心运输中的车辆衔接、存储分拣与时间窗口约束,生成保护隐私的数据;源代码和文档已发布在 GitHub。
Google Research 发布一项研究实验,利用面向学习优化的生成式 UI,让教师按课程目标动态创建定制的互动教育模拟。该系统通过递进关卡、分层提示、反馈和解答引导学生主动探究,并用教学、机制和视觉护栏及自校正循环检查生成结果。
Import AI 470 汇总了 AI 加速科学研究、SPADE 环境生成、Hawkeye GPU kernel 优化,以及机器权利等议题。文中引用 METR 分析称,AI 对网络安全带来明显加速,对数学研究是较小加速,而对 AI 研究尚未观察到可测量的加速。
Jack Clark 在 Import AI 469 中介绍了 DiG-bench 发现能力基准、RSI Simulator 递归自我改进模拟器,并讨论 AI 科学家 Faraday 与 Zuckerberg 对超级智能的观点。
IBM Research 将结构化 CUDA-to-MLX 翻译层接入 K-Search,使其能把 CUDA 内核知识迁移为 Apple Silicon 上的 MLX 内核。
推荐理由:文章展示了 CUDA 优化经验如何通过翻译层迁移到 MLX,并用 Attention 与 Mamba 的实测结果呈现这一路径的效果。
Berkeley AI Research 提出 ABBEL,将交互摘要表示为可监督的自然语言信念状态,让模型根据新观察更新记忆并据此行动。在 CollabBench 中,带重构式信念评分的 ABBEL 将与完整上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,同时使用更少的峰值上下文 token。
GRASP 提出一种面向学习型 World Model 的梯度规划器,通过虚拟状态并行优化、状态迭代注入随机性和梯度重塑,改善长时域规划。它在虚拟状态上注入 Gaussian noise,保留 action gradients,避开脆弱的 state-input gradients,并每隔 K_sync 次迭代用 serial rollout 做同步 refinement。
Berkeley AI Research 介绍 SPEX 和 ProxySPEX 两种算法,用较少的消融识别 LLM 中影响输出的特征、训练数据和模型组件交互。
Berkeley AI Research提出一个仅依赖含噪测量和噪声模型的框架,用互信息评估并优化成像系统的信息含量。NeurIPS 2025论文显示,该指标在彩色摄影、射电天文、无透镜成像和显微镜四个领域能够预测下游任务表现;IDEAL优化出的设计匹配端到端方法,同时需要更少内存和计算,且无需任务专用解码器设计。