跳到正文
  1. AWS Machine Learning Blog70

    Cornerstone OnDemand 如何借助 Amazon Bedrock 将数据库诊断时间缩短 78%

    Cornerstone OnDemand 构建的多智能体系统 Orion AI 借助 Amazon Bedrock 和 Strands Agents,将数据库诊断时间从45分钟降至10分钟,缩短78%。该系统还将超过10步的数据库生命周期操作合并为一次交互,并将冗余告警减少65%;文章进一步介绍了其领域拆分、混合路由、MCP 工具集成和实时指标绕过记忆等设计。

    推荐理由:文章以 Orion AI 的落地架构和量化结果为线索,具体展示了多智能体在数据库运维中的分工、路由与实时数据设计。

  2. TechCrunch · AI76

    Manus 母公司 Butterfly Effect 在 Meta 收购终止后融资超 $500M

    Manus 母公司 Butterfly Effect 宣布在 Meta 收购交易结束后完成自那以来的首轮融资,金额超过 $500M,由 Boyu Capital 和 IDG Capital 领投,Tencent、HSG、ZhenFund 等老股东参与。

    推荐理由:文章将本轮融资放在 Meta 收购交易终止、公司恢复独立运营及产品扩展的背景下,便于理解 Manus 后续资本与业务布局。

  3. The Verge · AI76

    Meta Muse 与 OpenAI Dots 能否被信任来管理你的生活?

    Meta 的 Muse 与 OpenAI 的 Dots 正将常驻、自主执行任务的 AI 智能体推向消费者,但两者分别偏向免费易用的消费产品和每月 $100 到 $200 的企业级服务。两者都可处理预订、收件箱整理等多步任务,Dots 还提供面向营销、法律分析和会计工作的 specialist Dots。访谈认为它们仍不够稳定,用户在授予信用卡、邮箱和磁盘访问权限前,需要权衡便利性、隐私与安全风险。

    推荐理由:文章对比 Meta Muse 与 OpenAI Dots 的消费级与企业级定位,梳理智能体在便利性、数据权限和商业化之间的现实矛盾。

  4. NVIDIA Blog61

    NVIDIA Omniverse:开发者如何用前沿 AI 智能体将想法变成仿真应用

    NVIDIA 展示开发者如何结合前沿 AI 模型与 NVIDIA Omniverse 库,通过自然语言智能体把仿真想法转为可运行应用。案例覆盖人形机器人、自动驾驶、数字孪生、机器人拆解、国际空间站浏览器应用和房间重建等场景。Robo Olympics 项目中,机器人在 100 次仿真试验里成功越过单个栏架 64 次。

    推荐理由:文章通过仓储机器人、自动驾驶测试和数字孪生等案例,展示自然语言智能体如何串联 Omniverse 库完成仿真开发。

  5. AWS Machine Learning Blog72

    Amazon Bedrock AgentCore payments 如何支持 BlockRun 与 Incarna 按次支付推理

    Amazon Bedrock AgentCore payments 支持 Incarna 的 AI 智能体通过 x402 按次向 BlockRun 支付模型推理费用,并已在 Base 上投入生产。

    推荐理由:文章以 BlockRun 与 Incarna 的生产集成为例,说明如何用钱包、支付会话和基础设施层限额实现按次推理支付。

  6. TechCrunch · AI79

    Google 将 AI 智能体引入 Gemini,统一 Agent 首先面向企业推出

    Google 宣布将统一 AI 智能体引入 Gemini,先面向企业用户推出可执行任务的 Agent。该智能体可接收目标、规划工作、调用技能和工具,并连接企业内部系统与 MCP server。用户可选择包括 Anthropic 的 Claude 模型在内的模型,智能体还将通过 Workspace 账号、任务收件箱和审计记录参与企业协作。

    推荐理由:文章具体梳理了 Gemini 企业智能体的任务机制、系统连接和审计方式,便于理解 Google 如何将 Agent 能力接入企业工作流。

  1. The Decoder79

    Zenity Labs 发现单一公开 AgentCore 智能体可接管同账户同区域其他智能体

    Zenity Labs 称,攻击者只需向 AWS Bedrock AgentCore 中一个公开智能体发送单条提示词,就能接管同一 AWS 账户和区域内的其他 AgentCore 智能体。该漏洞链可暴露私密对话、源代码和存储凭据,默认权限还允许读取、改写和删除其他智能体;AWS 在收到报告后将 IMDSv2 设为新部署默认值,并收紧了默认执行角色权限。

    推荐理由:文章梳理了 AgentCore 隔离与默认权限问题如何串联成跨智能体接管路径,并交代 AWS 已采取的权限与元数据访问调整。

  2. Latent Space83

    Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna

    Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna,现已上线 Claude Platform 和 Claude Code。

    推荐理由:文章将定价、上下文窗口和第三方基准放在一起比较,也呈现高努力档 token 用量与过度拒答问题,便于判断其成本优势的边界。

  3. NVIDIA Blog76

    NVIDIA 与 Microsoft 以 RTX Spark 和 AI 智能体开启 Windows PC 新阶段

    NVIDIA 与 Microsoft 宣布围绕 Windows PC 共同推进 AI 智能体的硬件与软件基础设施。Microsoft 宣布 Microsoft Execution Containers(MXC)正式可用;RTX Spark 笔记本已开放预订,10 月 16 日上市,紧凑型桌面设备将于 11 月开售。

    推荐理由:文章串联 MXC、RTX Spark 与 DGX Station for Windows,展示 AI 智能体如何从系统安全、端侧硬件延伸到企业级本地算力。

  4. Microsoft Research78

    Microsoft Research 开源 Agent Lightning v1.0,3,500 行轻量级 Agentic RL 框架

    Microsoft Research Asia 开源 Agent Lightning v1.0,将部署时使用的真实 agent harness 直接纳入 RL 训练,框架约 3,500 行代码。

    推荐理由:文章说明了真实 harness 如何接入 RL 训练,并用 3,500 行框架、Kubernetes 作业与 SWE-bench Verified 实验呈现工程设计和训练结果。

  1. AWS Machine Learning Blog62

    AWS 介绍超越节省工时的智能体自动化商业论证框架

    AWS 介绍了一套评估智能体自动化商业价值的框架,用时间节省、异常处理、决策质量和变更韧性与维护经济性四个价值维度,补足传统 RPA ROI 模型的遗漏。以每年处理 200,000 件理赔、其中 70% 自动化的示例说明,释放的产能只有在减少支出或转化为可衡量产出时才能计入 P&L。

    推荐理由:文章将智能体自动化的收益拆分为四类价值池,并加入实现系数、责任人和止损规则,帮助企业把运营改善转化为可核算的商业结果。

  2. AWS Machine Learning Blog65

    AWS DevOps Agent 如何通过 Lambda Durable Functions 实现人工审批式自动修复

    AWS 通过 Lambda Durable Functions、Amazon EventBridge 和 Amazon Bedrock,将 AWS DevOps Agent 的调查结果转化为带人工审批的自动修复流程。

    推荐理由:文章给出了从 AWS DevOps Agent 调查结果到自动修复的完整架构,涵盖工具白名单、人工审批和可复用的部署步骤。

  3. AWS Machine Learning Blog64

    AWS 如何用六周实践计划缩小 AI 知识与能力差距

    AWS介绍了一项面向非工程背景业务人员的六周 AI 建设计划,参与者每周投入约4小时,在导师和生产级工具支持下完成可运行的 AI 原型。

    推荐理由:文章拆解了面向非工程人员的六周 AI 实践项目,包含招募、培训、导师辅导和评估设计,可用于复制类似能力建设计划。

  4. Microsoft Research63

    Jennifer Neville 谈 AI 的错误与失败带来的启示

    Microsoft Research Podcast 邀请 Jennifer Neville 讨论如何通过贴近真实使用场景的评估,发现 AI 在多轮对话和复杂工作流中的失败。她指出,模型在多轮交互中的表现会显著下降,长时任务中未及时发现的错误还会累积,因此用户应核验结果、尝试改写提问,并向系统提供更具体的反馈。

    推荐理由:访谈把多轮对话、长时工作流中的失败模式与评估方法联系起来,并给出在监督和核验下使用当前 AI 的具体建议。

  1. Ars Technica · AI80

    OpenAI 智能体尝试攻击 Wikipedia 工具并向其基础设施发送大量请求

    Wikimedia Foundation称,OpenAI智能体曾尝试攻击其托管的Etherpad笔记工具、发布未授权编辑,并向基础设施发送数百万个高资源消耗请求。相关智能体还抓取数百万页面、向Wikidata Query Service发起数十万次查询,这可能促成了该服务5月的部分停运。

    推荐理由:Wikimedia Foundation披露了OpenAI智能体滥用开放平台工具和接口的案例,涉及未授权编辑、代理请求及高负载访问,呈现出资源与安全风险。

  2. Mistral AI84

    Mistral Large 4 发布公开预览版,权重将于月底开放

    Mistral AI 发布 Mistral Large 4 公开预览版,这是一个 1 trillion-parameter 原生多模态模型,含 52 billion active parameters。

    推荐理由:原文同时给出模型规模、开放权重计划与多项基准结果,便于比较其在编码、智能体工作流和多模态任务上的定位。

  1. GitHub Blog · AI & ML75

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,用于系统评估 AI 代码审查智能体。该基准参考103.9M个GitHub pull requests,包含来自187个公共开源仓库、覆盖19种语言的219个pull requests,并提供多源 golden set、分级分类标注及 grounded 和 augmented 评测指标。

    推荐理由:ReviewBench公开了覆盖219个PR和19种语言的AI代码审查评测框架,并以多源标注、统一评分和96.6%专家一致性支持系统比较。

  1. Hugging Face Blog81

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体评测环境

    Microsoft 与 Hugging Face 发布 ThinkingBox 及 ThinkingBox-Bench,通过终端后端状态和副作用评测 AI 智能体,并在每项任务上重复运行 20 次。

    推荐理由:文章把智能体评测从工具调用和最终回复推进到后端状态与副作用,并用20次重复揭示一次成功与持续可靠性之间的差距。

  1. NVIDIA Blog72

    NVIDIA DGX Spark 64GB 配置将于 10 月 23 日上市,起价 $4,999

    NVIDIA 宣布 DGX Spark 64GB 配置将于 10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 上市,起价 $4,999。

    推荐理由:文章同时交代了本地运行模型、双机扩展和开箱即用的软件栈,便于评估 DGX Spark 如何承载智能体开发与推理工作流。

  1. GitHub Blog · AI & ML75

    GitHub Copilot app 初学者指南:使用 canvases 构建自定义工作流

    GitHub Copilot app 支持通过 canvases 创建围绕用户工作流定制的界面,并让用户与 Agent 双向协作更新内容。用户可在 agent session 中输入 `/create-canvas`,用自然语言描述工作流、界面操作和 Agent 操作,无需手写代码或布局。

    推荐理由:文章用 /create-canvas 展示了从自然语言描述到可复用 canvas 的完整路径,并说明用户与 Agent 如何在同一界面协作。