16岁少年用 Claude 规划 Crown Mountain 登山路线遇险,最终获直升机救援
16岁少年用 Anthropic 的 Claude 规划温哥华 Crown Mountain 登顶路线,误入需要攀岩装备的陡峭悬崖后被直升机救出。救援负责人称 Claude 并不了解地点或地形,AI不能替代户外经验和常识;少年表示今后仍会攀登,但不再用 AI 规划路线。
16岁少年用 Anthropic 的 Claude 规划温哥华 Crown Mountain 登顶路线,误入需要攀岩装备的陡峭悬崖后被直升机救出。救援负责人称 Claude 并不了解地点或地形,AI不能替代户外经验和常识;少年表示今后仍会攀登,但不再用 AI 规划路线。
Anthropic 的 Claude Science 利用 AI agents 下载、校准并合并多项太空任务数据,绘制了完整的天空紫外线地图。项目使用 inpainting 补齐缺失区域,测试中预测结果与实际测量的平均偏差约为 10%。这张地图计划作为教学材料。
文章认为,现代 AI 依赖拒答机制阻止危险请求,但这种机制既可能被越狱绕过,也可能因过度拒答压制合法信息。文章指出,Anthropic 曾称一种分类器使聊天机器人的计算成本增加 24%,而拒答仍受概率机制影响。作者还警告,政府和企业对拒答边界的控制可能扩大审查与监控能力。
Anthropic 推出 OSS Scanner,为选择加入的开源项目提供免费、定期的漏洞扫描和报告,使用包括 Claude Mythos 在内的 Anthropic 模型。扫描结果完全由模型生成,不经过人工审核或分流,因此报告可能存在错误或无效信息。
Anthropic 为 Claude 推出两项 Beta 功能:Dashboards 可通过文本提示连接 BigQuery、Databricks、Snowflake 或 Salesforce,生成自动更新的实时仪表板;Motion 可从文本、图表和图片生成可编辑为代码并导出 MP4 的动画解释视频。
推荐理由:文章集中说明 Dashboards 与 Motion 的输入方式、输出形式和套餐范围,便于判断这些功能能否接入现有数据分析与内容制作流程。
Anthropic一年多来首次更新Claude使用政策,新增禁止用户持续且无必要地虐待Claude,并允许警告、限流、限制、暂停或终止访问。政策还整合并扩大了对宣传活动、武器、无人机武器化和未经同意监控的限制,同时保留政府合同可能获得例外的表述。Anthropic称该禁令不适用于常见的挫败表达、反驳、黑暗创作主题或模型测试研究,仅针对极端情况。
数学家组织 AHM 呼吁抵制 OpenAI,导火索是该公司一次性发布 700 多份 AI 生成证明,引发对验证负担、署名和数学研究方向的争议。Fields Medalist Terence Tao 认为,数学研究应重新重视解释、社区建设和新研究方向,而不应把解题数量作为主要进展指标。
Anthropic 于 10 月 8 日更新使用政策,新增对选举干预、武器软件、监控以及持续辱骂模型的明确禁令。政策还禁止利用 Claude 运营虚假账号或伪造新闻媒体、欺骗选民或扰乱选举,并说明持续辱骂禁令不针对一般用户挫折、反驳、黑暗创作主题或模型测试研究。
Anthropic更新Claude使用政策,禁止用户对模型进行“持续且无必要的辱骂或残酷行为”,并扩大对选举干预、武器相关软件和监控用途的限制。该公司称终止对话仍是主要执行机制;政策还限制误导性商业或政治活动,并要求连接到可能造成伤害的自主硬件时,必须有合格操作员能够观察并在需要时停止设备。
推荐理由:Anthropic此次政策更新同时覆盖模型福利、选举干预、武器与监控用途,呈现出其对Claude使用边界和实体行动风险的具体划分。
Anthropic 发布 Claude Haiku 5.5,定位为面向高并发、成本敏感任务的快速小型模型,平均价格比 Haiku 4.5 低约75%,不超过100,000 tokens 的 prompts 价格最高下降90%。
推荐理由:文章同时梳理 Claude Haiku 5.5 的价格、基准表现与 token 消耗,便于比较低成本模型在性能和资源使用上的取舍。
Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna,现已上线 Claude Platform 和 Claude Code。
推荐理由:文章将定价、上下文窗口和第三方基准放在一起比较,也呈现高努力档 token 用量与过度拒答问题,便于判断其成本优势的边界。
Anthropic 发布 Claude Haiku 5.5,定位为快速、低成本模型;其价格在 100,000 tokens 内为 $0.10/$0.50,超过后升至 $0.50/$2.50。
推荐理由:文章把 Claude Haiku 5.5 与 GPT-6 Luna 的分段价格、token 消耗和推理级别测试放在一起,便于判断不同上下文长度与推理设置下的实际成本。
Anthropic Claude Haiku 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线,面向高并发、成本敏感的子智能体与任务。
推荐理由:文章同时给出在 Amazon Bedrock 控制台和 bedrock-runtime 中调用 Claude Haiku 5.5 的步骤与代码,便于评估其在批量任务中的部署方式。
OpenAI 发布了来自内部数学模型的 722 篇手稿,内容按 372 个结果家族整理,平均每项使用约 3 小时 ChatGPT Pro 推理计算,但相关数学结果尚未经过独立验证。Latent Space 的 AINews 还汇总了 Mistral Large 4、EmbeddingGemma 2、Nano Banana 2.1、Decisions API,以及安全评测和开发者工具等近期动态。
Import AI 475 讨论 AI 智能体群体扩展、Google DeepMind 的 SynthID Bio 生物学水印及 AI 科学实验室。4-agent swarm 以约两倍总 tokens 达到单智能体相同性能,并行运行理论上可将耗时减半。