跳到正文
  1. NVIDIA Blog61

    NVIDIA Omniverse:开发者如何用前沿 AI 智能体将想法变成仿真应用

    NVIDIA 展示开发者如何结合前沿 AI 模型与 NVIDIA Omniverse 库,通过自然语言智能体把仿真想法转为可运行应用。案例覆盖人形机器人、自动驾驶、数字孪生、机器人拆解、国际空间站浏览器应用和房间重建等场景。Robo Olympics 项目中,机器人在 100 次仿真试验里成功越过单个栏架 64 次。

    推荐理由:文章通过仓储机器人、自动驾驶测试和数字孪生等案例,展示自然语言智能体如何串联 Omniverse 库完成仿真开发。

  2. The Decoder77

    Anthropic 为 Claude 推出 Dashboards 和 Motion 两项 Beta 功能

    Anthropic 为 Claude 推出两项 Beta 功能:Dashboards 可通过文本提示连接 BigQuery、Databricks、Snowflake 或 Salesforce,生成自动更新的实时仪表板;Motion 可从文本、图表和图片生成可编辑为代码并导出 MP4 的动画解释视频。

    推荐理由:文章集中说明 Dashboards 与 Motion 的输入方式、输出形式和套餐范围,便于判断这些功能能否接入现有数据分析与内容制作流程。

  3. AWS Machine Learning Blog72

    Amazon Bedrock AgentCore payments 如何支持 BlockRun 与 Incarna 按次支付推理

    Amazon Bedrock AgentCore payments 支持 Incarna 的 AI 智能体通过 x402 按次向 BlockRun 支付模型推理费用,并已在 Base 上投入生产。

    推荐理由:文章以 BlockRun 与 Incarna 的生产集成为例,说明如何用钱包、支付会话和基础设施层限额实现按次推理支付。

  4. TechCrunch · AI79

    Google 将 AI 智能体引入 Gemini,统一 Agent 首先面向企业推出

    Google 宣布将统一 AI 智能体引入 Gemini,先面向企业用户推出可执行任务的 Agent。该智能体可接收目标、规划工作、调用技能和工具,并连接企业内部系统与 MCP server。用户可选择包括 Anthropic 的 Claude 模型在内的模型,智能体还将通过 Workspace 账号、任务收件箱和审计记录参与企业协作。

    推荐理由:文章具体梳理了 Gemini 企业智能体的任务机制、系统连接和审计方式,便于理解 Google 如何将 Agent 能力接入企业工作流。

  5. The Verge · AI77

    Anthropic更新Claude使用政策,禁止持续且无必要的辱骂或残酷行为

    Anthropic更新Claude使用政策,禁止用户对模型进行“持续且无必要的辱骂或残酷行为”,并扩大对选举干预、武器相关软件和监控用途的限制。该公司称终止对话仍是主要执行机制;政策还限制误导性商业或政治活动,并要求连接到可能造成伤害的自主硬件时,必须有合格操作员能够观察并在需要时停止设备。

    推荐理由:Anthropic此次政策更新同时覆盖模型福利、选举干预、武器与监控用途,呈现出其对Claude使用边界和实体行动风险的具体划分。

  6. AWS Machine Learning Blog60

    Amazon SageMaker HyperPod 如何用 EKS 实现多团队 GPU 集群隔离与公平共享

    AWS Machine Learning Blog给出了一套基于 Amazon SageMaker HyperPod EKS 的多团队 GPU 集群参考架构,组合 AWS IAM Identity Center。

    推荐理由:文章将身份认证、IAM 与 Kubernetes RBAC、命名空间隔离、Task Governance 配额和成本分摊串成多团队 GPU 共享方案。

  1. The Decoder79

    Zenity Labs 发现单一公开 AgentCore 智能体可接管同账户同区域其他智能体

    Zenity Labs 称,攻击者只需向 AWS Bedrock AgentCore 中一个公开智能体发送单条提示词,就能接管同一 AWS 账户和区域内的其他 AgentCore 智能体。该漏洞链可暴露私密对话、源代码和存储凭据,默认权限还允许读取、改写和删除其他智能体;AWS 在收到报告后将 IMDSv2 设为新部署默认值,并收紧了默认执行角色权限。

    推荐理由:文章梳理了 AgentCore 隔离与默认权限问题如何串联成跨智能体接管路径,并交代 AWS 已采取的权限与元数据访问调整。

  2. The Decoder83

    Anthropic 发布 Claude Haiku 5.5,降价并提升基准表现

    Anthropic 发布 Claude Haiku 5.5,定位为面向高并发、成本敏感任务的快速小型模型,平均价格比 Haiku 4.5 低约75%,不超过100,000 tokens 的 prompts 价格最高下降90%。

    推荐理由:文章同时梳理 Claude Haiku 5.5 的价格、基准表现与 token 消耗,便于比较低成本模型在性能和资源使用上的取舍。

  3. Latent Space83

    Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna

    Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna,现已上线 Claude Platform 和 Claude Code。

    推荐理由:文章将定价、上下文窗口和第三方基准放在一起比较,也呈现高努力档 token 用量与过度拒答问题,便于判断其成本优势的边界。

  4. Hugging Face Blog82

    ML-intern 如何构建原本不存在的定制模型

    作者使用 HuggingChat 中的 ML-intern,在几天内构建并发布了六个定制模型,覆盖微调、LoRA、蒸馏和端侧运行。文章总结了提示词中加入基线、冒烟测试和预算上限的做法,六个项目的 GPU 与 CPU 作业总成本约 USD 103。

    推荐理由:文章用六个项目拆解 ML-intern 从数据准备到训练、评估和发布的流程,并给出基线、冒烟测试与预算控制等可复用的提示词设计方法。

  5. Simon Willison78

    Anthropic 发布 Claude Haiku 5.5

    Anthropic 发布 Claude Haiku 5.5,定位为快速、低成本模型;其价格在 100,000 tokens 内为 $0.10/$0.50,超过后升至 $0.50/$2.50。

    推荐理由:文章把 Claude Haiku 5.5 与 GPT-6 Luna 的分段价格、token 消耗和推理级别测试放在一起,便于判断不同上下文长度与推理设置下的实际成本。

  6. Google Research74

    Google 研究 AI 辅助是否提升专业判断:133 名专利律师的三个月实验

    Google Research 对 11 家知识产权律所的 133 名律师开展为期三个月的现场实验,研究 AI 辅助对专利撰写表现和未使用工具时专业判断的影响。AI 工具使撰写评分在第 10 天提升 0.34 SD、第 90 天提升 0.38 SD;但撤除 AI 后,红线修订任务的整体优势主要来自资深律师,初级律师没有明显改善。

    推荐理由:这项为期三个月的专利撰写实验区分了 AI 提升即时产出与培养长期判断力的效果,并比较了资深与初级律师在工具撤除后的表现。

  7. AWS Machine Learning Blog77

    Claude Haiku 5.5 登陆 Amazon Bedrock 和 Claude Platform on AWS

    Anthropic Claude Haiku 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线,面向高并发、成本敏感的子智能体与任务。

    推荐理由:文章同时给出在 Amazon Bedrock 控制台和 bedrock-runtime 中调用 Claude Haiku 5.5 的步骤与代码,便于评估其在批量任务中的部署方式。

  8. NVIDIA Blog76

    NVIDIA 与 Microsoft 以 RTX Spark 和 AI 智能体开启 Windows PC 新阶段

    NVIDIA 与 Microsoft 宣布围绕 Windows PC 共同推进 AI 智能体的硬件与软件基础设施。Microsoft 宣布 Microsoft Execution Containers(MXC)正式可用;RTX Spark 笔记本已开放预订,10 月 16 日上市,紧凑型桌面设备将于 11 月开售。

    推荐理由:文章串联 MXC、RTX Spark 与 DGX Station for Windows,展示 AI 智能体如何从系统安全、端侧硬件延伸到企业级本地算力。

  9. AWS Machine Learning Blog65

    Amazon Quick 与 Amazon Bedrock Knowledge Bases 重新思考 RAG 访问控制

    Amazon Quick 与 Amazon Bedrock Knowledge Bases 通过查询时实时 ACL 核验,为 RAG 增加直接向权威数据源验证权限的安全层。该双层架构先用索引中缓存的 ACL 筛选候选文档,再调用数据源 API 实时确认用户权限,仅将获授权的内容传给 LLM。

    推荐理由:文章拆解 Amazon Quick 与 Amazon Bedrock Knowledge Bases 的双层 ACL 架构,说明缓存筛选如何与查询时权限核验结合以兼顾检索效率和访问安全。

  10. GitHub Blog · AI & ML69

    GitHub Secret Protection引入ModernBERT分类器,扩展AI密钥检测

    GitHub在Secret Protection中引入ModernBERT分类器,可在低于 2 毫秒内评估候选密钥,并有望将能够阻止的密钥数量提高至两倍以上。

    推荐理由:文章结合九个季度数据解释代码增长下密钥保护的扩展压力,并介绍低于 2 毫秒完成候选检测、可将阻止数量提高至两倍以上的方案。

  11. Hugging Face Blog74

    Liquid AI 发布面向端侧的多模态决策模型 d1-3B 与 d1-omni-600M

    Liquid AI 发布两款开放权重决策模型 d1-3B 和实验性的 d1-omni-600M,分别支持文本与图像、文本与图像或文本与音频输入。在七个公开数据集上,d1-3B 的平均分为 82.9,d1-omni-600M 为 78.4;d1-3B 在 Jetson AGX Thor 上单个问题延迟为 16 ms,在 Jetson Orin Nano 上为 50 ms。

    推荐理由:文章将模型结构、公开数据集对比和端侧延迟放在一起,便于判断两款决策模型在质量、模态支持与设备部署之间的取舍。

  12. Microsoft Research78

    Microsoft Research 开源 Agent Lightning v1.0,3,500 行轻量级 Agentic RL 框架

    Microsoft Research Asia 开源 Agent Lightning v1.0,将部署时使用的真实 agent harness 直接纳入 RL 训练,框架约 3,500 行代码。

    推荐理由:文章说明了真实 harness 如何接入 RL 训练,并用 3,500 行框架、Kubernetes 作业与 SWE-bench Verified 实验呈现工程设计和训练结果。

  1. AWS Machine Learning Blog62

    AWS 介绍超越节省工时的智能体自动化商业论证框架

    AWS 介绍了一套评估智能体自动化商业价值的框架,用时间节省、异常处理、决策质量和变更韧性与维护经济性四个价值维度,补足传统 RPA ROI 模型的遗漏。以每年处理 200,000 件理赔、其中 70% 自动化的示例说明,释放的产能只有在减少支出或转化为可衡量产出时才能计入 P&L。

    推荐理由:文章将智能体自动化的收益拆分为四类价值池,并加入实现系数、责任人和止损规则,帮助企业把运营改善转化为可核算的商业结果。

  2. AWS Machine Learning Blog65

    AWS DevOps Agent 如何通过 Lambda Durable Functions 实现人工审批式自动修复

    AWS 通过 Lambda Durable Functions、Amazon EventBridge 和 Amazon Bedrock,将 AWS DevOps Agent 的调查结果转化为带人工审批的自动修复流程。

    推荐理由:文章给出了从 AWS DevOps Agent 调查结果到自动修复的完整架构,涵盖工具白名单、人工审批和可复用的部署步骤。