跳到正文

技术方向

部署工程 最新动态

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

21 条精选近 30 天 17 条共收录 37 条

更新

部署工程的精选

今天10月9日周五第 1–20 条
  1. AWS Machine Learning Blog70

    Cornerstone OnDemand 如何借助 Amazon Bedrock 将数据库诊断时间缩短 78%

    Cornerstone OnDemand 构建的多智能体系统 Orion AI 借助 Amazon Bedrock 和 Strands Agents,将数据库诊断时间从45分钟降至10分钟,缩短78%。该系统还将超过10步的数据库生命周期操作合并为一次交互,并将冗余告警减少65%;文章进一步介绍了其领域拆分、混合路由、MCP 工具集成和实时指标绕过记忆等设计。

    推荐理由:文章以 Orion AI 的落地架构和量化结果为线索,具体展示了多智能体在数据库运维中的分工、路由与实时数据设计。

  2. NVIDIA Blog61

    NVIDIA Omniverse:开发者如何用前沿 AI 智能体将想法变成仿真应用

    NVIDIA 展示开发者如何结合前沿 AI 模型与 NVIDIA Omniverse 库,通过自然语言智能体把仿真想法转为可运行应用。案例覆盖人形机器人、自动驾驶、数字孪生、机器人拆解、国际空间站浏览器应用和房间重建等场景。Robo Olympics 项目中,机器人在 100 次仿真试验里成功越过单个栏架 64 次。

    推荐理由:文章通过仓储机器人、自动驾驶测试和数字孪生等案例,展示自然语言智能体如何串联 Omniverse 库完成仿真开发。

10月8日周四
  1. Hugging Face Blog82

    ML-intern 如何构建原本不存在的定制模型

    作者使用 HuggingChat 中的 ML-intern,在几天内构建并发布了六个定制模型,覆盖微调、LoRA、蒸馏和端侧运行。文章总结了提示词中加入基线、冒烟测试和预算上限的做法,六个项目的 GPU 与 CPU 作业总成本约 USD 103。

    推荐理由:文章用六个项目拆解 ML-intern 从数据准备到训练、评估和发布的流程,并给出基线、冒烟测试与预算控制等可复用的提示词设计方法。

  2. NVIDIA Blog76

    NVIDIA 与 Microsoft 以 RTX Spark 和 AI 智能体开启 Windows PC 新阶段

    NVIDIA 与 Microsoft 宣布围绕 Windows PC 共同推进 AI 智能体的硬件与软件基础设施。Microsoft 宣布 Microsoft Execution Containers(MXC)正式可用;RTX Spark 笔记本已开放预订,10 月 16 日上市,紧凑型桌面设备将于 11 月开售。

    推荐理由:文章串联 MXC、RTX Spark 与 DGX Station for Windows,展示 AI 智能体如何从系统安全、端侧硬件延伸到企业级本地算力。

10月7日周三
  1. AWS Machine Learning Blog62

    AWS 介绍超越节省工时的智能体自动化商业论证框架

    AWS 介绍了一套评估智能体自动化商业价值的框架,用时间节省、异常处理、决策质量和变更韧性与维护经济性四个价值维度,补足传统 RPA ROI 模型的遗漏。以每年处理 200,000 件理赔、其中 70% 自动化的示例说明,释放的产能只有在减少支出或转化为可衡量产出时才能计入 P&L。

    推荐理由:文章将智能体自动化的收益拆分为四类价值池,并加入实现系数、责任人和止损规则,帮助企业把运营改善转化为可核算的商业结果。

  2. AWS Machine Learning Blog65

    AWS DevOps Agent 如何通过 Lambda Durable Functions 实现人工审批式自动修复

    AWS 通过 Lambda Durable Functions、Amazon EventBridge 和 Amazon Bedrock,将 AWS DevOps Agent 的调查结果转化为带人工审批的自动修复流程。

    推荐理由:文章给出了从 AWS DevOps Agent 调查结果到自动修复的完整架构,涵盖工具白名单、人工审批和可复用的部署步骤。

  3. AWS Machine Learning Blog64

    AWS 如何用六周实践计划缩小 AI 知识与能力差距

    AWS介绍了一项面向非工程背景业务人员的六周 AI 建设计划,参与者每周投入约4小时,在导师和生产级工具支持下完成可运行的 AI 原型。

    推荐理由:文章拆解了面向非工程人员的六周 AI 实践项目,包含招募、培训、导师辅导和评估设计,可用于复制类似能力建设计划。

10月2日周五
  1. Google Research77

    Google Research 探索基于 TEE 的可验证隐私联邦学习

    Google Research 发布基于 Trusted Execution Environments(TEEs)的新一代联邦学习系统,为服务器端数据处理提供可验证、可审计的匿名化保障。

    推荐理由:文章把 TEE、访问策略、公开透明日志与可复现构建串成一套联邦学习架构,具体呈现服务器端处理如何获得可审计的隐私保障。

9月25日周五
  1. GitHub Blog · AI & ML79

    GitHub Copilot 的 canvas:为什么聊天有时不是正确的 UI

    GitHub Copilot 文章提出,聊天并非 AI 任务的最佳交互界面,canvas 可在 GitHub Copilot app 内提供可定制的全栈应用界面。Canvas 能调用第三方 API、执行本地代码,并与 GitHub Copilot agent 双向通信。文章还展示了 Connect 4、Winget、SQLite 以及开发流程自动化等用例。

    推荐理由:文章通过 Connect 4、Winget、SQLite 和开发流程案例,展示 GitHub Copilot canvas 如何把聊天请求转为可交互工具与自动化工作流。

  2. GitHub Blog · AI & ML76

    GitHub Security Lab Taskflow Agent 如何实现 AI 驱动的 C/C++ 模糊测试

    GitHub Security Lab 的 Fuzzing Taskflow 面向 C/C++ 项目自动完成入口识别、构建分析、harness 编写、AFL++ 模糊测试、覆盖率改进、崩溃归因和漏洞报告生成。

    推荐理由:文章拆解了从覆盖率反馈、结构感知输入到崩溃归因的自动化链路,也说明了 LLM 判断与 MCP 执行分离的工程设计及运行风险。

9月24日周四
  1. GitHub Blog · AI & ML62

    GitHub Copilot app 重建超大 Pull Request 渲染体验

    GitHub Copilot app 重建了 Pull Request 视图,让包含 2,200 个文件、超过一百万行变更和 400 多条行内评论的超大变更仍能打开、滚动并完整呈现评论。方案将确定性的代码几何与动态评论块分开,按视口延迟测量,并通过滚动锚定减少位置跳动。团队还使用结构化探针和自动化 change → measure → improve 循环,在真实应用中检测性能问题。

    推荐理由:文章拆解了 GitHub Copilot app 如何分离代码行与动态评论的几何计算,并用自动化测量循环定位超大 Pull Request 中的性能问题。

  2. Microsoft Research72

    Microsoft Physical AI Toolchain 新增机器人推理卸载能力

    Microsoft Physical AI Toolchain 新增机器人物理 AI 推理卸载能力,可将工作负载分布到机器人、边缘 GPU 和云端。Microsoft Research 的测量显示,卸载可提升任务成功率、支持更大模型并延长电池续航;较小 GPU 上映射和规划最多慢 383%,导航及时障碍检测下降 30%,VLA 准确率下降 50%。

    推荐理由:原文以移动机器人操作任务的实测数据比较本地、边缘与云端推理,并介绍 Kubernetes 工具链如何支持部署。

9月9日周三
  1. Mistral AI67

    Mistral AI 如何用 AI 智能体现代化复杂遗留代码

    Mistral AI 协助一家欧洲能源运营商将40,000行Fortran 77迁移到C++,涉及一个没有测试套件和集中式文档的物理建模储层模拟器。项目先建立数值一致性校验框架并整理代码文档,再按模块运行规划、实现、测试和人工审查流程;Mistral还使用Vibe CLI调度超过100个智能体为代码生成文档。

    推荐理由:文章以40,000行Fortran 77迁移为案例,具体展示如何用数值一致性校验、文档整理和人工审查约束智能体工作流。

8月20日周四
  1. Mistral AI73

    Mistral Agentic Search 发布复杂文档智能检索能力

    Mistral AI 发布 Agentic Search,将多步搜索、文档导航、读取和验证接入检索层,以处理长文档、跨文档和表格问题。在 FinanceBench 上,正确率从 26.7% 提升至 86%;在 OfficeQA Pro 上从 6.3% 提升至 51.9%,p90 延迟最多降低 39.6%,token 消耗最多减少三分之一。

    推荐理由:文章用 FinanceBench 和 OfficeQA Pro 的对比数据,说明多步检索如何在复杂文档问答中提高准确率并减少 token 消耗与延迟。

7月29日周三