跳到正文
  1. AWS Machine Learning Blog70

    Cornerstone OnDemand 如何借助 Amazon Bedrock 将数据库诊断时间缩短 78%

    Cornerstone OnDemand 构建的多智能体系统 Orion AI 借助 Amazon Bedrock 和 Strands Agents,将数据库诊断时间从45分钟降至10分钟,缩短78%。该系统还将超过10步的数据库生命周期操作合并为一次交互,并将冗余告警减少65%;文章进一步介绍了其领域拆分、混合路由、MCP 工具集成和实时指标绕过记忆等设计。

    推荐理由:文章以 Orion AI 的落地架构和量化结果为线索,具体展示了多智能体在数据库运维中的分工、路由与实时数据设计。

  2. NVIDIA Blog61

    NVIDIA Omniverse:开发者如何用前沿 AI 智能体将想法变成仿真应用

    NVIDIA 展示开发者如何结合前沿 AI 模型与 NVIDIA Omniverse 库,通过自然语言智能体把仿真想法转为可运行应用。案例覆盖人形机器人、自动驾驶、数字孪生、机器人拆解、国际空间站浏览器应用和房间重建等场景。Robo Olympics 项目中,机器人在 100 次仿真试验里成功越过单个栏架 64 次。

    推荐理由:文章通过仓储机器人、自动驾驶测试和数字孪生等案例,展示自然语言智能体如何串联 Omniverse 库完成仿真开发。

  3. AWS Machine Learning Blog72

    Amazon Bedrock AgentCore payments 如何支持 BlockRun 与 Incarna 按次支付推理

    Amazon Bedrock AgentCore payments 支持 Incarna 的 AI 智能体通过 x402 按次向 BlockRun 支付模型推理费用,并已在 Base 上投入生产。

    推荐理由:文章以 BlockRun 与 Incarna 的生产集成为例,说明如何用钱包、支付会话和基础设施层限额实现按次推理支付。

  1. NVIDIA Blog76

    NVIDIA 与 Microsoft 以 RTX Spark 和 AI 智能体开启 Windows PC 新阶段

    NVIDIA 与 Microsoft 宣布围绕 Windows PC 共同推进 AI 智能体的硬件与软件基础设施。Microsoft 宣布 Microsoft Execution Containers(MXC)正式可用;RTX Spark 笔记本已开放预订,10 月 16 日上市,紧凑型桌面设备将于 11 月开售。

    推荐理由:文章串联 MXC、RTX Spark 与 DGX Station for Windows,展示 AI 智能体如何从系统安全、端侧硬件延伸到企业级本地算力。

  2. Microsoft Research78

    Microsoft Research 开源 Agent Lightning v1.0,3,500 行轻量级 Agentic RL 框架

    Microsoft Research Asia 开源 Agent Lightning v1.0,将部署时使用的真实 agent harness 直接纳入 RL 训练,框架约 3,500 行代码。

    推荐理由:文章说明了真实 harness 如何接入 RL 训练,并用 3,500 行框架、Kubernetes 作业与 SWE-bench Verified 实验呈现工程设计和训练结果。

  1. AWS Machine Learning Blog62

    AWS 介绍超越节省工时的智能体自动化商业论证框架

    AWS 介绍了一套评估智能体自动化商业价值的框架,用时间节省、异常处理、决策质量和变更韧性与维护经济性四个价值维度,补足传统 RPA ROI 模型的遗漏。以每年处理 200,000 件理赔、其中 70% 自动化的示例说明,释放的产能只有在减少支出或转化为可衡量产出时才能计入 P&L。

    推荐理由:文章将智能体自动化的收益拆分为四类价值池,并加入实现系数、责任人和止损规则,帮助企业把运营改善转化为可核算的商业结果。

  2. AWS Machine Learning Blog65

    AWS DevOps Agent 如何通过 Lambda Durable Functions 实现人工审批式自动修复

    AWS 通过 Lambda Durable Functions、Amazon EventBridge 和 Amazon Bedrock,将 AWS DevOps Agent 的调查结果转化为带人工审批的自动修复流程。

    推荐理由:文章给出了从 AWS DevOps Agent 调查结果到自动修复的完整架构,涵盖工具白名单、人工审批和可复用的部署步骤。

  3. AWS Machine Learning Blog64

    AWS 如何用六周实践计划缩小 AI 知识与能力差距

    AWS介绍了一项面向非工程背景业务人员的六周 AI 建设计划,参与者每周投入约4小时,在导师和生产级工具支持下完成可运行的 AI 原型。

    推荐理由:文章拆解了面向非工程人员的六周 AI 实践项目,包含招募、培训、导师辅导和评估设计,可用于复制类似能力建设计划。

  4. Microsoft Research63

    Jennifer Neville 谈 AI 的错误与失败带来的启示

    Microsoft Research Podcast 邀请 Jennifer Neville 讨论如何通过贴近真实使用场景的评估,发现 AI 在多轮对话和复杂工作流中的失败。她指出,模型在多轮交互中的表现会显著下降,长时任务中未及时发现的错误还会累积,因此用户应核验结果、尝试改写提问,并向系统提供更具体的反馈。

    推荐理由:访谈把多轮对话、长时工作流中的失败模式与评估方法联系起来,并给出在监督和核验下使用当前 AI 的具体建议。

  1. Mistral AI84

    Mistral Large 4 发布公开预览版,权重将于月底开放

    Mistral AI 发布 Mistral Large 4 公开预览版,这是一个 1 trillion-parameter 原生多模态模型,含 52 billion active parameters。

    推荐理由:原文同时给出模型规模、开放权重计划与多项基准结果,便于比较其在编码、智能体工作流和多模态任务上的定位。

  1. GitHub Blog · AI & ML75

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,用于系统评估 AI 代码审查智能体。该基准参考103.9M个GitHub pull requests,包含来自187个公共开源仓库、覆盖19种语言的219个pull requests,并提供多源 golden set、分级分类标注及 grounded 和 augmented 评测指标。

    推荐理由:ReviewBench公开了覆盖219个PR和19种语言的AI代码审查评测框架,并以多源标注、统一评分和96.6%专家一致性支持系统比较。

  1. Hugging Face Blog81

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体评测环境

    Microsoft 与 Hugging Face 发布 ThinkingBox 及 ThinkingBox-Bench,通过终端后端状态和副作用评测 AI 智能体,并在每项任务上重复运行 20 次。

    推荐理由:文章把智能体评测从工具调用和最终回复推进到后端状态与副作用,并用20次重复揭示一次成功与持续可靠性之间的差距。

  1. NVIDIA Blog72

    NVIDIA DGX Spark 64GB 配置将于 10 月 23 日上市,起价 $4,999

    NVIDIA 宣布 DGX Spark 64GB 配置将于 10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 上市,起价 $4,999。

    推荐理由:文章同时交代了本地运行模型、双机扩展和开箱即用的软件栈,便于评估 DGX Spark 如何承载智能体开发与推理工作流。

  1. GitHub Blog · AI & ML75

    GitHub Copilot app 初学者指南:使用 canvases 构建自定义工作流

    GitHub Copilot app 支持通过 canvases 创建围绕用户工作流定制的界面,并让用户与 Agent 双向协作更新内容。用户可在 agent session 中输入 `/create-canvas`,用自然语言描述工作流、界面操作和 Agent 操作,无需手写代码或布局。

    推荐理由:文章用 /create-canvas 展示了从自然语言描述到可复用 canvas 的完整路径,并说明用户与 Agent 如何在同一界面协作。

  1. GitHub Blog · AI & ML79

    GitHub Copilot 的 canvas:为什么聊天有时不是正确的 UI

    GitHub Copilot 文章提出,聊天并非 AI 任务的最佳交互界面,canvas 可在 GitHub Copilot app 内提供可定制的全栈应用界面。Canvas 能调用第三方 API、执行本地代码,并与 GitHub Copilot agent 双向通信。文章还展示了 Connect 4、Winget、SQLite 以及开发流程自动化等用例。

    推荐理由:文章通过 Connect 4、Winget、SQLite 和开发流程案例,展示 GitHub Copilot canvas 如何把聊天请求转为可交互工具与自动化工作流。

  2. Google Research66

    Google Research 研究如何自动生成连贯长视频

    Google Research 介绍一套基于 Gemini 和 Veo 的 AI 视频协导演示研究,通过多智能体编排视觉连续性,生成分钟级长视频并缓解视觉漂移与流水线错误传播。

    推荐理由:文章将长视频生成拆解为创意编排、视觉记忆、时序扩展和闭环优化四个框架,并给出对应基准结果,便于理解一致性问题的解决路径。

  3. GitHub Blog · AI & ML76

    GitHub Security Lab Taskflow Agent 如何实现 AI 驱动的 C/C++ 模糊测试

    GitHub Security Lab 的 Fuzzing Taskflow 面向 C/C++ 项目自动完成入口识别、构建分析、harness 编写、AFL++ 模糊测试、覆盖率改进、崩溃归因和漏洞报告生成。

    推荐理由:文章拆解了从覆盖率反馈、结构感知输入到崩溃归因的自动化链路,也说明了 LLM 判断与 MCP 执行分离的工程设计及运行风险。

  1. Berkeley AI Research62

    智能近乎免费后怎么办?面向、支撑和由智能体构建的数据系统

    Berkeley AI Research 的这篇观点文章认为,近乎零成本的模型推理将带来三类数据系统挑战:面向智能体优化、支撑多智能体群体运行,以及由智能体按工作负载合成定制数据系统。

    推荐理由:文章将近零推理成本带来的变化拆分为面向智能体、支撑智能体群体以及由智能体构建数据系统三条研究主线。

已经到底了