Anthropic 发布 Claude Haiku 5.5,降价并提升基准表现
Anthropic 发布 Claude Haiku 5.5,定位为面向高并发、成本敏感任务的快速小型模型,平均价格比 Haiku 4.5 低约75%,不超过100,000 tokens 的 prompts 价格最高下降90%。
推荐理由:文章同时梳理 Claude Haiku 5.5 的价格、基准表现与 token 消耗,便于比较低成本模型在性能和资源使用上的取舍。
技术方向
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
9 条精选近 30 天 9 条共收录 16 条
Anthropic 发布 Claude Haiku 5.5,定位为面向高并发、成本敏感任务的快速小型模型,平均价格比 Haiku 4.5 低约75%,不超过100,000 tokens 的 prompts 价格最高下降90%。
推荐理由:文章同时梳理 Claude Haiku 5.5 的价格、基准表现与 token 消耗,便于比较低成本模型在性能和资源使用上的取舍。
Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna,现已上线 Claude Platform 和 Claude Code。
推荐理由:文章将定价、上下文窗口和第三方基准放在一起比较,也呈现高努力档 token 用量与过度拒答问题,便于判断其成本优势的边界。
Anthropic 发布 Claude Haiku 5.5,定位为快速、低成本模型;其价格在 100,000 tokens 内为 $0.10/$0.50,超过后升至 $0.50/$2.50。
推荐理由:文章把 Claude Haiku 5.5 与 GPT-6 Luna 的分段价格、token 消耗和推理级别测试放在一起,便于判断不同上下文长度与推理设置下的实际成本。
Nemotron 团队从 Nemotron 3 出发,结合 SFT、RL 和反馈驱动推理,在 IOI 2026 得到 535.4/600,在 IMO 2026 得到 30/42,均达到金牌级门槛。
推荐理由:文章对比了 Nemotron 在 IOI 与 IMO 中的专门化路径,具体展示微调、反馈推理和验证流程如何协同提升竞赛表现。
Mistral AI 发布 Mistral Large 4 公开预览版,这是一个 1 trillion-parameter 原生多模态模型,含 52 billion active parameters。
推荐理由:原文同时给出模型规模、开放权重计划与多项基准结果,便于比较其在编码、智能体工作流和多模态任务上的定位。
NVIDIA 宣布 DGX Spark 64GB 配置将于 10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 上市,起价 $4,999。
推荐理由:文章同时交代了本地运行模型、双机扩展和开箱即用的软件栈,便于评估 DGX Spark 如何承载智能体开发与推理工作流。
OpenAI GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPUs 上运行,并通过 OpenAI API 和面向符合条件的 ChatGPT Work、Codex 用户提供。
推荐理由:文章把 GPT-6 Astra Ultrafast 的 8x token 生成提升与编码智能体的工具调用循环联系起来,并说明了 Blackwell 上的推理优化路径。
Google 发布新模型 Gemini 4 Argon,面向软件工程、企业知识工作和网络安全防御等复杂长流程任务,当前先向 Fairwind Program 的可信网络防御者开放。
推荐理由:原文将 Gemini 4 Argon 的长程推理、企业工作流与网络安全能力放在同一发布框架中,并给出价格、评测成绩和分阶段开放计划。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向规模化语音交互与高复杂度、多步骤推理任务。
推荐理由:原文同时给出两款模型的定位、语音交互能力、基准成绩与开发者和企业端入口,便于比较其适用场景。