跳到正文
  1. The Decoder83

    Anthropic 发布 Claude Haiku 5.5,降价并提升基准表现

    Anthropic 发布 Claude Haiku 5.5,定位为面向高并发、成本敏感任务的快速小型模型,平均价格比 Haiku 4.5 低约75%,不超过100,000 tokens 的 prompts 价格最高下降90%。

    推荐理由:文章同时梳理 Claude Haiku 5.5 的价格、基准表现与 token 消耗,便于比较低成本模型在性能和资源使用上的取舍。

  2. Latent Space83

    Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna

    Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna,现已上线 Claude Platform 和 Claude Code。

    推荐理由:文章将定价、上下文窗口和第三方基准放在一起比较,也呈现高努力档 token 用量与过度拒答问题,便于判断其成本优势的边界。

  3. Simon Willison78

    Anthropic 发布 Claude Haiku 5.5

    Anthropic 发布 Claude Haiku 5.5,定位为快速、低成本模型;其价格在 100,000 tokens 内为 $0.10/$0.50,超过后升至 $0.50/$2.50。

    推荐理由:文章把 Claude Haiku 5.5 与 GPT-6 Luna 的分段价格、token 消耗和推理级别测试放在一起,便于判断不同上下文长度与推理设置下的实际成本。

  4. Hugging Face Blog74

    Liquid AI 发布面向端侧的多模态决策模型 d1-3B 与 d1-omni-600M

    Liquid AI 发布两款开放权重决策模型 d1-3B 和实验性的 d1-omni-600M,分别支持文本与图像、文本与图像或文本与音频输入。在七个公开数据集上,d1-3B 的平均分为 82.9,d1-omni-600M 为 78.4;d1-3B 在 Jetson AGX Thor 上单个问题延迟为 16 ms,在 Jetson Orin Nano 上为 50 ms。

    推荐理由:文章将模型结构、公开数据集对比和端侧延迟放在一起,便于判断两款决策模型在质量、模态支持与设备部署之间的取舍。

  1. OpenAI News82

    GPT-6 搭载 Intelligent UI 全球上线 ChatGPT

    GPT-6 正在全球 ChatGPT 中上线,并配备 Intelligent UI。此次更新提供更快响应,以及可探索和直接使用的视觉与交互体验。

    推荐理由:原文交代了 GPT-6 在 ChatGPT 的全球上线,以及 Intelligent UI 带来的响应速度和交互体验变化。

  2. Google DeepMind77

    Google DeepMind 发布 EmbeddingGemma 2 多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间,面向端侧推理。

    推荐理由:EmbeddingGemma 2 将文本、图像、音频和视频统一到共享嵌入空间,并公开端侧内存、上下文和向量压缩数据,便于判断其本地检索适用性。

  1. Mistral AI84

    Mistral Large 4 发布公开预览版,权重将于月底开放

    Mistral AI 发布 Mistral Large 4 公开预览版,这是一个 1 trillion-parameter 原生多模态模型,含 52 billion active parameters。

    推荐理由:原文同时给出模型规模、开放权重计划与多项基准结果,便于比较其在编码、智能体工作流和多模态任务上的定位。

  1. Hugging Face Blog67

    AstaBrief 8B 科学报告生成模型开源

    Ai2 开源 AstaBrief 8B,用于将研究问题和检索到的文献摘录生成带引用报告。该模型已作为 Asta 的 Fast mode 使用,平均每份报告耗时 51.1 秒,相比 Thinking mode 的 178.5 秒约快 3.5×。除模型权重外,团队还发布了训练数据和可从自有 PDF 生成报告的示例工作流。

    推荐理由:AstaBrief 8B 的训练数据筛选、引用归因指标与部署方式,为科学报告模型的开源复现提供了具体参考。

  2. NVIDIA Blog75

    NVIDIA GPUs 如何加速 OpenAI GPT-6 Astra Ultrafast

    OpenAI GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPUs 上运行,并通过 OpenAI API 和面向符合条件的 ChatGPT Work、Codex 用户提供。

    推荐理由:文章把 GPT-6 Astra Ultrafast 的 8x token 生成提升与编码智能体的工具调用循环联系起来,并说明了 Blackwell 上的推理优化路径。

  1. Google DeepMind80

    Google 发布 Gemini 4 Argon,支持 1M tokens 输出并将分阶段开放

    Google 发布新模型 Gemini 4 Argon,面向软件工程、企业知识工作和网络安全防御等复杂长流程任务,当前先向 Fairwind Program 的可信网络防御者开放。

    推荐理由:原文将 Gemini 4 Argon 的长程推理、企业工作流与网络安全能力放在同一发布框架中,并给出价格、评测成绩和分阶段开放计划。

  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,分别面向创意声音设计与高吞吐、成本高效的语音生成。

    推荐理由:原文同时交代两款 TTS 模型的定位、声音定制与逐句导演能力,以及 Google AI Studio 和 Gemini API 的开放入口,便于判断其创作与部署场景。

  1. Google DeepMind85

    Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向规模化语音交互与高复杂度、多步骤推理任务。

    推荐理由:原文同时给出两款模型的定位、语音交互能力、基准成绩与开发者和企业端入口,便于比较其适用场景。

  1. Microsoft Research61

    Microsoft Research 发布 GigaPath-Flash 与 GigaTIME-Flash 高效病理基础模型

    Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 两个开放权重病理基础模型,面向更高效的全切片分析和肿瘤微环境研究。

    推荐理由:文章展示了 GigaPath-Flash 与 GigaTIME-Flash 如何以更低计算成本处理大规模病理数据,并给出模型结构、基准表现与资源估算。

已经到底了