Nemotron 通过微调在 IOI 2026 与 IMO 2026 达到金牌级成绩
Nemotron 团队从 Nemotron 3 出发,结合 SFT、RL 和反馈驱动推理,在 IOI 2026 得到 535.4/600,在 IMO 2026 得到 30/42,均达到金牌级门槛。
推荐理由:文章对比了 Nemotron 在 IOI 与 IMO 中的专门化路径,具体展示微调、反馈推理和验证流程如何协同提升竞赛表现。
Nemotron 团队从 Nemotron 3 出发,结合 SFT、RL 和反馈驱动推理,在 IOI 2026 得到 535.4/600,在 IMO 2026 得到 30/42,均达到金牌级门槛。
推荐理由:文章对比了 Nemotron 在 IOI 与 IMO 中的专门化路径,具体展示微调、反馈推理和验证流程如何协同提升竞赛表现。
Microsoft 与 Hugging Face 发布 ThinkingBox 及 ThinkingBox-Bench,通过终端后端状态和副作用评测 AI 智能体,并在每项任务上重复运行 20 次。
推荐理由:文章把智能体评测从工具调用和最终回复推进到后端状态与副作用,并用20次重复揭示一次成功与持续可靠性之间的差距。
Google DeepMind 推出 SynthID Bio,可将不可感知且可验证的水印嵌入 AI 生成蛋白质的生物代码及预测结构中。在 VEGF-A、SARS-CoV-2 spike protein RBD 和 PD-L1 三种靶蛋白的湿实验中,水印设计保持了命中率、结合亲和力和自然序列多样性。
推荐理由:文章把 AI 生成蛋白质的来源追踪与实验功能验证结合起来,具体展示了水印在序列和三维结构中的嵌入方式及三种靶蛋白上的测试结果。
Hugging Face 发布 Open TTS Leaderboard,使用 WER/CER、RTFx、TTFA 和说话人相似度等客观指标评测开放式、多语言 TTS 模型。
推荐理由:Hugging Face 将多语言、语音克隆、推理速度与流式延迟纳入统一评测,为开放 TTS 模型提供更可扩展的比较维度。
IBM Research 将结构化 CUDA-to-MLX 翻译层接入 K-Search,使其能把 CUDA 内核知识迁移为 Apple Silicon 上的 MLX 内核。
推荐理由:文章展示了 CUDA 优化经验如何通过翻译层迁移到 MLX,并用 Attention 与 Mamba 的实测结果呈现这一路径的效果。