Oracle 如何用 ChatGPT 和 Codex 将数天工作缩短至数分钟
Oracle 借助 ChatGPT Work 和 Codex,将数天的工作缩短至数分钟,并把专业知识转化为快速、可重复的工作流程。这些流程覆盖招聘、工程与运营,面向不同业务场景复用专家知识。
Oracle 借助 ChatGPT Work 和 Codex,将数天的工作缩短至数分钟,并把专业知识转化为快速、可重复的工作流程。这些流程覆盖招聘、工程与运营,面向不同业务场景复用专家知识。
LegalOn 将估算的 Codex 日成本降低 65%,同时保持开发速度。团队将 Astra、Sol 和 Luna 与任务匹配,并通过策略性管理预算控制支出。
Anthropic 发布 Claude Haiku 5.5,定位为面向高并发、成本敏感任务的快速小型模型,平均价格比 Haiku 4.5 低约75%,不超过100,000 tokens 的 prompts 价格最高下降90%。
推荐理由:文章同时梳理 Claude Haiku 5.5 的价格、基准表现与 token 消耗,便于比较低成本模型在性能和资源使用上的取舍。
GitHub在Secret Protection中引入ModernBERT分类器,可在低于 2 毫秒内评估候选密钥,并有望将能够阻止的密钥数量提高至两倍以上。
推荐理由:文章结合九个季度数据解释代码增长下密钥保护的扩展压力,并介绍低于 2 毫秒完成候选检测、可将阻止数量提高至两倍以上的方案。
Microsoft Research Asia 开源 Agent Lightning v1.0,将部署时使用的真实 agent harness 直接纳入 RL 训练,框架约 3,500 行代码。
推荐理由:文章说明了真实 harness 如何接入 RL 训练,并用 3,500 行框架、Kubernetes 作业与 SWE-bench Verified 实验呈现工程设计和训练结果。
Mistral 发布可免费使用和定制的 1 trillion 参数模型 Mistral Large 4,昵称 Le Chonk,目前处于预览阶段,最终版本计划月底推出。该模型面向通用任务,但特别优化了编码、网络防御、制造、金融和电气工程等领域;Mistral 称其从头训练,并可与顶尖模型竞争。
Nemotron 团队从 Nemotron 3 出发,结合 SFT、RL 和反馈驱动推理,在 IOI 2026 得到 535.4/600,在 IMO 2026 得到 30/42,均达到金牌级门槛。
推荐理由:文章对比了 Nemotron 在 IOI 与 IMO 中的专门化路径,具体展示微调、反馈推理和验证流程如何协同提升竞赛表现。
Mistral AI 发布 Mistral Large 4 公开预览版,这是一个 1 trillion-parameter 原生多模态模型,含 52 billion active parameters。
推荐理由:原文同时给出模型规模、开放权重计划与多项基准结果,便于比较其在编码、智能体工作流和多模态任务上的定位。
Reflection 宣布 Beam,一款面向 coding、AI 智能体和科学工作的纯文本 501B-total / 23B-active MoE,采用从头训练,完整权重预计本月按 Apache 2.0 发布。
GitHub 发布 ReviewBench,用于系统评估 AI 代码审查智能体。该基准参考103.9M个GitHub pull requests,包含来自187个公共开源仓库、覆盖19种语言的219个pull requests,并提供多源 golden set、分级分类标注及 grounded 和 augmented 评测指标。
推荐理由:ReviewBench公开了覆盖219个PR和19种语言的AI代码审查评测框架,并以多源标注、统一评分和96.6%专家一致性支持系统比较。
AI 正在改变开发者工作,开发者需要学会指导 AI、评估其输出,并用节省的实现时间解决更大的技术问题。面对 AI agents,开发者仍需负责定义任务、审查结果和权衡技术方案。GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型评审计划、代码和测试。
OpenAI GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPUs 上运行,并通过 OpenAI API 和面向符合条件的 ChatGPT Work、Codex 用户提供。
推荐理由:文章把 GPT-6 Astra Ultrafast 的 8x token 生成提升与编码智能体的工具调用循环联系起来,并说明了 Blackwell 上的推理优化路径。
Google 发布新模型 Gemini 4 Argon,面向软件工程、企业知识工作和网络安全防御等复杂长流程任务,当前先向 Fairwind Program 的可信网络防御者开放。
推荐理由:原文将 Gemini 4 Argon 的长程推理、企业工作流与网络安全能力放在同一发布框架中,并给出价格、评测成绩和分阶段开放计划。
GitHub Copilot app 重建了 Pull Request 视图,让包含 2,200 个文件、超过一百万行变更和 400 多条行内评论的超大变更仍能打开、滚动并完整呈现评论。方案将确定性的代码几何与动态评论块分开,按视口延迟测量,并通过滚动锚定减少位置跳动。团队还使用结构化探针和自动化 change → measure → improve 循环,在真实应用中检测性能问题。
推荐理由:文章拆解了 GitHub Copilot app 如何分离代码行与动态评论的几何计算,并用自动化测量循环定位超大 Pull Request 中的性能问题。
GitHub Podcast 重新审视“无需阅读 AI 生成代码”“RAG 已死”“Skills 杀死 MCP”等常见 AI 观点,指出生成代码仍需审查并由开发者负责。MCP 提供工具与数据连接标准,Skills 提供流程、上下文和最佳实践,两者可以协同;RAG 仍能通过检索训练数据之外的信息,帮助模型缩小搜索范围、减少不完整回答。AI 辅助开发也凸显了代码结构、命名、测试和文档对可维护性的价值。
Mistral AI 协助一家欧洲能源运营商将40,000行Fortran 77迁移到C++,涉及一个没有测试套件和集中式文档的物理建模储层模拟器。项目先建立数值一致性校验框架并整理代码文档,再按模块运行规划、实现、测试和人工审查流程;Mistral还使用Vibe CLI调度超过100个智能体为代码生成文档。
推荐理由:文章以40,000行Fortran 77迁移为案例,具体展示如何用数值一致性校验、文档整理和人工审查约束智能体工作流。
Import AI 470 汇总了 AI 加速科学研究、SPADE 环境生成、Hawkeye GPU kernel 优化,以及机器权利等议题。文中引用 METR 分析称,AI 对网络安全带来明显加速,对数学研究是较小加速,而对 AI 研究尚未观察到可测量的加速。