Anthropic 推出面向开源项目的免费 OSS Scanner 安全扫描服务
Anthropic 推出 OSS Scanner,为选择加入的开源项目提供免费、定期的漏洞扫描和报告,使用包括 Claude Mythos 在内的 Anthropic 模型。扫描结果完全由模型生成,不经过人工审核或分流,因此报告可能存在错误或无效信息。
Anthropic 推出 OSS Scanner,为选择加入的开源项目提供免费、定期的漏洞扫描和报告,使用包括 Claude Mythos 在内的 Anthropic 模型。扫描结果完全由模型生成,不经过人工审核或分流,因此报告可能存在错误或无效信息。
数学家组织 AHM 呼吁抵制 OpenAI,导火索是该公司一次性发布 700 多份 AI 生成证明,引发对验证负担、署名和数学研究方向的争议。Fields Medalist Terence Tao 认为,数学研究应重新重视解释、社区建设和新研究方向,而不应把解题数量作为主要进展指标。
作者使用 HuggingChat 中的 ML-intern,在几天内构建并发布了六个定制模型,覆盖微调、LoRA、蒸馏和端侧运行。文章总结了提示词中加入基线、冒烟测试和预算上限的做法,六个项目的 GPU 与 CPU 作业总成本约 USD 103。
推荐理由:文章用六个项目拆解 ML-intern 从数据准备到训练、评估和发布的流程,并给出基线、冒烟测试与预算控制等可复用的提示词设计方法。
Mistral 发布可免费使用和定制的 1 trillion 参数模型 Mistral Large 4,昵称 Le Chonk,目前处于预览阶段,最终版本计划月底推出。该模型面向通用任务,但特别优化了编码、网络防御、制造、金融和电气工程等领域;Mistral 称其从头训练,并可与顶尖模型竞争。
Stacklok 正通过开源 Mecatl 云原生 Harness,将智能体循环与客户端、模型提供商、状态存储和执行环境分离,以支持企业在 Kubernetes 上集中管理智能体。
Nemotron 团队从 Nemotron 3 出发,结合 SFT、RL 和反馈驱动推理,在 IOI 2026 得到 535.4/600,在 IMO 2026 得到 30/42,均达到金牌级门槛。
推荐理由:文章对比了 Nemotron 在 IOI 与 IMO 中的专门化路径,具体展示微调、反馈推理和验证流程如何协同提升竞赛表现。
电信运营商正将 AI 战略建立在开放模型之上,以降低成本,并获得面向网络、客服等关键业务的定制、治理与部署控制。NVIDIA报告显示,89%的受访者认为开源模型和软件对公司 AI 战略重要;NVIDIA还发布30-billion-parameter Nemotron 3 Large Telco Model(LTM)及完整微调方案。
Reflection 宣布 Beam,一款面向 coding、AI 智能体和科学工作的纯文本 501B-total / 23B-active MoE,采用从头训练,完整权重预计本月按 Apache 2.0 发布。
Microsoft 与 Hugging Face 发布 ThinkingBox 及 ThinkingBox-Bench,通过终端后端状态和副作用评测 AI 智能体,并在每项任务上重复运行 20 次。
推荐理由:文章把智能体评测从工具调用和最终回复推进到后端状态与副作用,并用20次重复揭示一次成功与持续可靠性之间的差距。
Ai2 开源 AstaBrief 8B,用于将研究问题和检索到的文献摘录生成带引用报告。该模型已作为 Asta 的 Fast mode 使用,平均每份报告耗时 51.1 秒,相比 Thinking mode 的 178.5 秒约快 3.5×。除模型权重外,团队还发布了训练数据和可从自有 PDF 生成报告的示例工作流。
推荐理由:AstaBrief 8B 的训练数据筛选、引用归因指标与部署方式,为科学报告模型的开源复现提供了具体参考。
Google DeepMind 推出 SynthID Bio,可将不可感知且可验证的水印嵌入 AI 生成蛋白质的生物代码及预测结构中。在 VEGF-A、SARS-CoV-2 spike protein RBD 和 PD-L1 三种靶蛋白的湿实验中,水印设计保持了命中率、结合亲和力和自然序列多样性。
推荐理由:文章把 AI 生成蛋白质的来源追踪与实验功能验证结合起来,具体展示了水印在序列和三维结构中的嵌入方式及三种靶蛋白上的测试结果。
Hugging Face 发布 Open TTS Leaderboard,使用 WER/CER、RTFx、TTFA 和说话人相似度等客观指标评测开放式、多语言 TTS 模型。
推荐理由:Hugging Face 将多语言、语音克隆、推理速度与流式延迟纳入统一评测,为开放 TTS 模型提供更可扩展的比较维度。
Microsoft Physical AI Toolchain 新增机器人物理 AI 推理卸载能力,可将工作负载分布到机器人、边缘 GPU 和云端。Microsoft Research 的测量显示,卸载可提升任务成功率、支持更大模型并延长电池续航;较小 GPU 上映射和规划最多慢 383%,导航及时障碍检测下降 30%,VLA 准确率下降 50%。
推荐理由:原文以移动机器人操作任务的实测数据比较本地、边缘与云端推理,并介绍 Kubernetes 工具链如何支持部署。
Microsoft Research 在 Nature 发表 RetroChimera 逆合成模型研究,并开源其实现与权重。RetroChimera 结合 Transformer 模型 R-SMILES 2 与基于 GNN 的 NeuralLoc,通过学习重排序整合两者预测;在包含十个挑战性目标的专家评估中,它完成了其中九个目标的路线规划。
Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 两个开放权重病理基础模型,面向更高效的全切片分析和肿瘤微环境研究。
推荐理由:文章展示了 GigaPath-Flash 与 GigaTIME-Flash 如何以更低计算成本处理大规模病理数据,并给出模型结构、基准表现与资源估算。
Import AI 468 汇总了自动化 AI R&D 的政策建议、AI 竞速中的信任与透明度研究、PostTrainBench+ 结果及 OpenAI Agent 事件。
IBM Research 将结构化 CUDA-to-MLX 翻译层接入 K-Search,使其能把 CUDA 内核知识迁移为 Apple Silicon 上的 MLX 内核。
推荐理由:文章展示了 CUDA 优化经验如何通过翻译层迁移到 MLX,并用 Attention 与 Mamba 的实测结果呈现这一路径的效果。