ML-intern 如何构建原本不存在的定制模型
作者使用 HuggingChat 中的 ML-intern,在几天内构建并发布了六个定制模型,覆盖微调、LoRA、蒸馏和端侧运行。文章总结了提示词中加入基线、冒烟测试和预算上限的做法,六个项目的 GPU 与 CPU 作业总成本约 USD 103。
推荐理由:文章用六个项目拆解 ML-intern 从数据准备到训练、评估和发布的流程,并给出基线、冒烟测试与预算控制等可复用的提示词设计方法。
作者使用 HuggingChat 中的 ML-intern,在几天内构建并发布了六个定制模型,覆盖微调、LoRA、蒸馏和端侧运行。文章总结了提示词中加入基线、冒烟测试和预算上限的做法,六个项目的 GPU 与 CPU 作业总成本约 USD 103。
推荐理由:文章用六个项目拆解 ML-intern 从数据准备到训练、评估和发布的流程,并给出基线、冒烟测试与预算控制等可复用的提示词设计方法。
Microsoft Research Podcast 邀请 Jennifer Neville 讨论如何通过贴近真实使用场景的评估,发现 AI 在多轮对话和复杂工作流中的失败。她指出,模型在多轮交互中的表现会显著下降,长时任务中未及时发现的错误还会累积,因此用户应核验结果、尝试改写提问,并向系统提供更具体的反馈。
推荐理由:访谈把多轮对话、长时工作流中的失败模式与评估方法联系起来,并给出在监督和核验下使用当前 AI 的具体建议。
Google Research 使用 Population Dynamics Foundation Model(PDFM)的隐私保护位置嵌入,评估其在五类公共卫生任务中的表现。
推荐理由:文章把 PDFM 放入五类公共卫生任务中比较,具体结果展示了地理嵌入在跨境免疫、疾病预测和资源规划中的可迁移价值。
Ai2 开源 AstaBrief 8B,用于将研究问题和检索到的文献摘录生成带引用报告。该模型已作为 Asta 的 Fast mode 使用,平均每份报告耗时 51.1 秒,相比 Thinking mode 的 178.5 秒约快 3.5×。除模型权重外,团队还发布了训练数据和可从自有 PDF 生成报告的示例工作流。
推荐理由:AstaBrief 8B 的训练数据筛选、引用归因指标与部署方式,为科学报告模型的开源复现提供了具体参考。
Google Research 发布基于 Trusted Execution Environments(TEEs)的新一代联邦学习系统,为服务器端数据处理提供可验证、可审计的匿名化保障。
推荐理由:文章把 TEE、访问策略、公开透明日志与可复现构建串成一套联邦学习架构,具体呈现服务器端处理如何获得可审计的隐私保障。
ServiceNow CoreAI 构建 AutoSynthData,根据目标模型的失败和教师模型的成功生成、验证面向企业环境的智能体训练任务。任务由系统规范、用户提示和验证器组成,并经过可执行性、正负验证及批量覆盖检查。
Microsoft Research 开发了一套机器学习流程,为美国本土 66,935 座变电站生成空间天气风险预测。系统结合太阳风信息、AE 和 Dst 预测、当地地质条件及电网数据,可提前 30-60 分钟估计具体地点的风险。
Google Research推出 MilleMiglia,一款用 C++ 编写、用于生成中程物流逼真基准实例的生成器。它通过空间—时间图上的多商品流模型,捕捉跨配送中心运输中的车辆衔接、存储分拣与时间窗口约束,生成保护隐私的数据;源代码和文档已发布在 GitHub。
Google DeepMind 推出 AlphaGenome Atlas,提供人类基因组 9 billion 个单核苷酸变异的分子影响预测。该平台包含 1-petabyte 数据集,并通过 AVI score 汇总 AlphaGenome 与 AlphaMissense 的预测,支持变异排序和功能解释。
推荐理由:文章展示了 AlphaGenome Atlas 如何用 9 billion 个变异预测和 AVI score,帮助研究者筛选罕见病及复杂性状相关的遗传变异。
Berkeley AI Research 提出 ABBEL,将交互摘要表示为可监督的自然语言信念状态,让模型根据新观察更新记忆并据此行动。在 CollabBench 中,带重构式信念评分的 ABBEL 将与完整上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,同时使用更少的峰值上下文 token。