Anthropic 更新使用政策,禁止模型滥用与选举干预
Anthropic 于 10 月 8 日更新使用政策,新增对选举干预、武器软件、监控以及持续辱骂模型的明确禁令。政策还禁止利用 Claude 运营虚假账号或伪造新闻媒体、欺骗选民或扰乱选举,并说明持续辱骂禁令不针对一般用户挫折、反驳、黑暗创作主题或模型测试研究。
Anthropic 于 10 月 8 日更新使用政策,新增对选举干预、武器软件、监控以及持续辱骂模型的明确禁令。政策还禁止利用 Claude 运营虚假账号或伪造新闻媒体、欺骗选民或扰乱选举,并说明持续辱骂禁令不针对一般用户挫折、反驳、黑暗创作主题或模型测试研究。
OpenAI 发布了 719 份数学证明手稿,但其披露方式未完全符合 AGMAI 对前沿数学研究的建议。仅 10 份手稿公开了模型思维链,42% 的证明未经过形式化,发布内容也缺少关联自然语言证明与形式化结果的机器可读元数据。
USA Today Co.及其旗下多家地方报纸起诉 OpenAI,指控其未经许可复制“数十万篇”文章用于训练 AI 模型。诉讼要求超过 $250 million 的赔偿,并称 OpenAI 对相关内容的使用已持续损害其媒体业务。
SpaceXAI 加入负责 Omarchy 的 Omacom Foundation,成为 Founding Corporate Patron,并向该项目捐赠价值 $1.5 million 的 Grok tokens。
Anthropic更新Claude使用政策,禁止用户对模型进行“持续且无必要的辱骂或残酷行为”,并扩大对选举干预、武器相关软件和监控用途的限制。该公司称终止对话仍是主要执行机制;政策还限制误导性商业或政治活动,并要求连接到可能造成伤害的自主硬件时,必须有合格操作员能够观察并在需要时停止设备。
推荐理由:Anthropic此次政策更新同时覆盖模型福利、选举干预、武器与监控用途,呈现出其对Claude使用边界和实体行动风险的具体划分。
Periodic Labs 的 Liam Fedus 与 Ekin Doğuş Çubuk 讨论以物理实验训练 AI 科学家,探索材料发现中的合成超级智能。访谈解释了强化学习如何处理物理世界中的不确定性、噪声和有限样本,以及预测、合成、表征、模拟和 DFT 如何组成材料发现闭环。他们还讨论了让实验室设备具备智能、利用失败实验数据,以及扩展自动化实验室网络。
AWS Machine Learning Blog给出了一套基于 Amazon SageMaker HyperPod EKS 的多团队 GPU 集群参考架构,组合 AWS IAM Identity Center。
推荐理由:文章将身份认证、IAM 与 Kubernetes RBAC、命名空间隔离、Task Governance 配额和成本分摊串成多团队 GPU 共享方案。
Oracle 借助 ChatGPT Work 和 Codex,将数天的工作缩短至数分钟,并把专业知识转化为快速、可重复的工作流程。这些流程覆盖招聘、工程与运营,面向不同业务场景复用专家知识。
Google 发布实验性 AI 记事应用 Google AI Edge Foresight,可在 macOS 上使用公司的端侧 EmbeddingGemma 2 模型,完全离线转写会议和音频文件。
Google 发布面向企业工作的“通用”Gemini AI agent,支持跨应用和设备在后台执行任务。该功能将集成于 Gemini Enterprise app,可连接 Gmail、Drive、Docs、Sheets、Calendar、Slack 和 Microsoft 365,并在云端保持跨设备上下文。
两位 Ethereum 研究人员警告,AI 辅助数学在最坏情况下可能在数月内攻破加密钱包使用的签名系统。Justin Drake 建议行业进入“bunker mode”,将资金迁移到从未签署过交易的地址;Vitalik Buterin 则提醒不要过快行动,并主张长期尽可能依赖哈希函数。目前尚无人实际攻破现有的 ECDSA 签名方案。
Zenity Labs 称,攻击者只需向 AWS Bedrock AgentCore 中一个公开智能体发送单条提示词,就能接管同一 AWS 账户和区域内的其他 AgentCore 智能体。该漏洞链可暴露私密对话、源代码和存储凭据,默认权限还允许读取、改写和删除其他智能体;AWS 在收到报告后将 IMDSv2 设为新部署默认值,并收紧了默认执行角色权限。
推荐理由:文章梳理了 AgentCore 隔离与默认权限问题如何串联成跨智能体接管路径,并交代 AWS 已采取的权限与元数据访问调整。
《Gears of War: E-Day》在全球发行后登陆 GeForce NOW,Ultimate members 可在云端以 GeForce RTX 5080-class performance 游玩。
LegalOn 将估算的 Codex 日成本降低 65%,同时保持开发速度。团队将 Astra、Sol 和 Luna 与任务匹配,并通过策略性管理预算控制支出。
Pollo AI 借助 OpenAI 的 GPT-5.6、GPT-6 Astra 和 GPT‑Image‑2.5,将创意转化为包含详细图像与电影感视频广告的营销活动。该服务帮助创作者把大胆想法制作成图像和电影感视频广告。
Nvidia Halos 通过持续监控硬件与软件、隔离安全关键计算任务,帮助机器人和自动驾驶系统识别故障与受损传感器数据。该软件包还包含 Nvidia Holoscan Sensor Bridge、虚拟环境仿真和检查实验室项目;面向机器人时,Nvidia 还需要支持开发者为不同场景定义可编程的自定义安全函数。
Anthropic 发布 Claude Haiku 5.5,定位为面向高并发、成本敏感任务的快速小型模型,平均价格比 Haiku 4.5 低约75%,不超过100,000 tokens 的 prompts 价格最高下降90%。
推荐理由:文章同时梳理 Claude Haiku 5.5 的价格、基准表现与 token 消耗,便于比较低成本模型在性能和资源使用上的取舍。
AI 在机器人领域的进展尚不足以让人形机器人在短期内可靠承担家庭或工厂中的通用任务。Google DeepMind 的 Gemini Robotics 通过 VLA 完成打包午餐等任务,但遇到训练数据之外的任务仍容易失败;world model 被视为可能的替代路径,目前仍处于早期研究阶段。
AVEVA 的责任 AI 框架将安全、效率、人员安全与监督置于自主工业 AI 部署核心。其首席技术官 Arti Garg 主张 AI 应增强而非取代关键决策中的人,并以护栏划定自动系统与人工监督的边界。工业领域过去两年的 AI 采用率据一项研究或接近增长 78%,应用正扩展至物理 AI、智能体 AI、机器人和无人机。
Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna,现已上线 Claude Platform 和 Claude Code。
推荐理由:文章将定价、上下文窗口和第三方基准放在一起比较,也呈现高努力档 token 用量与过度拒答问题,便于判断其成本优势的边界。
Microsoft 发布 Surface Laptop Ultra,并公布 Windows 11 的多项变化及本地 AI、智能体工作流愿景。该设备搭载 Nvidia RTX Spark SoC,配备 5120-core 或 6144-core Blackwell GPU、最高 128GB LPDDR5x unified memory,起售价为 $2,599,将于 October 16 开始发货。
作者使用 HuggingChat 中的 ML-intern,在几天内构建并发布了六个定制模型,覆盖微调、LoRA、蒸馏和端侧运行。文章总结了提示词中加入基线、冒烟测试和预算上限的做法,六个项目的 GPU 与 CPU 作业总成本约 USD 103。
推荐理由:文章用六个项目拆解 ML-intern 从数据准备到训练、评估和发布的流程,并给出基线、冒烟测试与预算控制等可复用的提示词设计方法。
OpenAI 宣布已瓦解两起利用 AI 的影响行动,这些行动借助冒充记者的人员和一家智库传播地缘政治信息。
Ben Affleck谈到自己从小接触计算机,并因电影从模拟胶片转向数字化而关注视觉特效中的机器学习。 그는解释称,卷积神经网络可处理代表画面像素的 tensor,进行 edge detection 和 feature extraction,以识别窗台等特征,便于抠除绿幕并替换背景;他也会写 Python 脚本。
Artcraft 的开发者 Brandon Thomas 宣布推出七款开源应用,复刻 Adobe Photoshop、Illustrator、Premiere、Lightroom、After Effects、InDesign 和 Acrobat Pro 的界面与工具。
Anthropic 发布 Claude Haiku 5.5,定位为快速、低成本模型;其价格在 100,000 tokens 内为 $0.10/$0.50,超过后升至 $0.50/$2.50。
推荐理由:文章把 Claude Haiku 5.5 与 GPT-6 Luna 的分段价格、token 消耗和推理级别测试放在一起,便于判断不同上下文长度与推理设置下的实际成本。
Google Research 对 11 家知识产权律所的 133 名律师开展为期三个月的现场实验,研究 AI 辅助对专利撰写表现和未使用工具时专业判断的影响。AI 工具使撰写评分在第 10 天提升 0.34 SD、第 90 天提升 0.38 SD;但撤除 AI 后,红线修订任务的整体优势主要来自资深律师,初级律师没有明显改善。
推荐理由:这项为期三个月的专利撰写实验区分了 AI 提升即时产出与培养长期判断力的效果,并比较了资深与初级律师在工具撤除后的表现。
Anthropic Claude Haiku 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线,面向高并发、成本敏感的子智能体与任务。
推荐理由:文章同时给出在 Amazon Bedrock 控制台和 bedrock-runtime 中调用 Claude Haiku 5.5 的步骤与代码,便于评估其在批量任务中的部署方式。
NVIDIA 与 Microsoft 宣布围绕 Windows PC 共同推进 AI 智能体的硬件与软件基础设施。Microsoft 宣布 Microsoft Execution Containers(MXC)正式可用;RTX Spark 笔记本已开放预订,10 月 16 日上市,紧凑型桌面设备将于 11 月开售。
推荐理由:文章串联 MXC、RTX Spark 与 DGX Station for Windows,展示 AI 智能体如何从系统安全、端侧硬件延伸到企业级本地算力。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 通过查询时实时 ACL 核验,为 RAG 增加直接向权威数据源验证权限的安全层。该双层架构先用索引中缓存的 ACL 筛选候选文档,再调用数据源 API 实时确认用户权限,仅将获授权的内容传给 LLM。
推荐理由:文章拆解 Amazon Quick 与 Amazon Bedrock Knowledge Bases 的双层 ACL 架构,说明缓存筛选如何与查询时权限核验结合以兼顾检索效率和访问安全。
Smith因使用1万机器人和AI歌曲实施流媒体欺诈,被判处18个月监禁,并被法院裁定没收其通过该计划声称获得的$8,091,843.64。美国司法部称,他的人工刷量侵占了流媒体平台的版税池并影响真实艺术家;辩护律师则认为判刑过重,法院最终采纳了检方关于欺骗手段和威慑必要性的主张。
GitHub在Secret Protection中引入ModernBERT分类器,可在低于 2 毫秒内评估候选密钥,并有望将能够阻止的密钥数量提高至两倍以上。
推荐理由:文章结合九个季度数据解释代码增长下密钥保护的扩展压力,并介绍低于 2 毫秒完成候选检测、可将阻止数量提高至两倍以上的方案。
Liquid AI 发布两款开放权重决策模型 d1-3B 和实验性的 d1-omni-600M,分别支持文本与图像、文本与图像或文本与音频输入。在七个公开数据集上,d1-3B 的平均分为 82.9,d1-omni-600M 为 78.4;d1-3B 在 Jetson AGX Thor 上单个问题延迟为 16 ms,在 Jetson Orin Nano 上为 50 ms。
推荐理由:文章将模型结构、公开数据集对比和端侧延迟放在一起,便于判断两款决策模型在质量、模态支持与设备部署之间的取舍。
Microsoft Research Asia 开源 Agent Lightning v1.0,将部署时使用的真实 agent harness 直接纳入 RL 训练,框架约 3,500 行代码。
推荐理由:文章说明了真实 harness 如何接入 RL 训练,并用 3,500 行框架、Kubernetes 作业与 SWE-bench Verified 实验呈现工程设计和训练结果。
AWS 介绍了一套评估智能体自动化商业价值的框架,用时间节省、异常处理、决策质量和变更韧性与维护经济性四个价值维度,补足传统 RPA ROI 模型的遗漏。以每年处理 200,000 件理赔、其中 70% 自动化的示例说明,释放的产能只有在减少支出或转化为可衡量产出时才能计入 P&L。
推荐理由:文章将智能体自动化的收益拆分为四类价值池,并加入实现系数、责任人和止损规则,帮助企业把运营改善转化为可核算的商业结果。
Qlik 在 Amazon Bedrock 上构建 Qlik Answers,为企业员工提供可追溯来源的自然语言问答,并支持知识库、分析应用、术语表和文档等来源。
AWS 通过 Lambda Durable Functions、Amazon EventBridge 和 Amazon Bedrock,将 AWS DevOps Agent 的调查结果转化为带人工审批的自动修复流程。
推荐理由:文章给出了从 AWS DevOps Agent 调查结果到自动修复的完整架构,涵盖工具白名单、人工审批和可复用的部署步骤。
AWS介绍了一项面向非工程背景业务人员的六周 AI 建设计划,参与者每周投入约4小时,在导师和生产级工具支持下完成可运行的 AI 原型。
推荐理由:文章拆解了面向非工程人员的六周 AI 实践项目,包含招募、培训、导师辅导和评估设计,可用于复制类似能力建设计划。
Michael Lynch总结软件博客写作中的常见反模式,提醒作者避免冗长迂回的开场、误判读者已有知识、假设读者读过旧文,以及过度正式和只靠链接解释术语。随着越来越多开发者把写作交给 AI,软件博客正变得平淡同质,作者应使用自己的声音,让文章即使读者不点击链接也能自洽,并保留个性。
Mistral 发布可免费使用和定制的 1 trillion 参数模型 Mistral Large 4,昵称 Le Chonk,目前处于预览阶段,最终版本计划月底推出。该模型面向通用任务,但特别优化了编码、网络防御、制造、金融和电气工程等领域;Mistral 称其从头训练,并可与顶尖模型竞争。