Horizon 每日速递 - 2026-08-14

从 94 条内容中筛选出 10 条重要资讯。


  1. OpenAI 发布 GPT-5.6 构建指南:更快、更省成本的 AI Agent ⭐️ 10.0/10
  2. OpenAI 预览超快速 API 层级:GPT-5.6 Sol 提速 14 倍 ⭐️ 9.0/10
  3. Grok 4.6 重回第一梯队,低价反超 Fable 5 ⭐️ 9.0/10
  4. Gemini 3.7 Flash 现已登陆 GitHub Copilot ⭐️ 9.0/10
  5. DeepSeek 发布开源 Harness 工具,带 Web UI 界面 ⭐️ 8.0/10
  6. DeepSeek 发布 V4 Pro 正式版,API 价格分时段大幅上调 ⭐️ 8.0/10
  7. 谷歌正在输掉 AI 竞赛吗?Decoder 剖析 DeepMind 重组 ⭐️ 8.0/10
  8. 深度体验 DeepSeek Harness,我原谅它涨价了 ⭐️ 8.0/10
  9. Claude Code v2.1.232:默认子代理分叉、跨会话消息与 GitLab 令牌脱敏 ⭐️ 7.0/10
  10. Writer 推出基于 GLM-5.2 的 AI 模型,配备降本 harness ⭐️ 7.0/10

OpenAI 发布 GPT-5.6 构建指南:更快、更省成本的 AI Agent ⭐️ 10.0/10

OpenAI 发布了一份官方的 GPT-5.6 构建者指南,介绍初创公司如何使用这一新模型构建更快、更具成本效益的 AI Agent。指南重点强调了更智能的模型选择以及增强后的 Responses API 能力。 这份指南很重要,因为它为开发者提供了围绕 GPT-5.6 构建 Agent 流程的实用建议,而这类流程正日益成为现代 AI 应用的核心。同时,它也表明 OpenAI 持续致力于让 Agent 开发对初创公司和企业来说更易用、更具经济效益。 GPT-5.6 提供三个变体——Sol、Terra 和 Luna——每个变体针对不同的性能和成本需求而设计,其中 Sol 被 OpenAI 称为“目前为止最好的编程模型”。该指南还重点介绍了 Responses API,该 API 旨在通过将 Chat Completions 与高级工具调用相结合来简化 Agent 应用的开发。

rss · OpenAI News · 8月13日 11:00

背景: GPT-5.6 是 OpenAI 于 2026 年 7 月左右发布的大型语言模型系列,专为处理复杂推理、编程和 Agent 工作流而设计。Responses API 于 2025 年 3 月 11 日发布,是用于生成模型响应的高级接口,支持文本和图像输入,并简化了工具编排。据 OpenAI 介绍,GPT-5.6 可以编写并运行轻量级程序来协调工具、处理中间结果、监控进度并决定下一步动作,从而在工具密集型任务中减少 token 消耗和模型往返次数。

参考链接

标签: #OpenAI, #GPT-5.6, #AI agents, #Responses API, #developer tools


OpenAI 预览超快速 API 层级:GPT-5.6 Sol 提速 14 倍 ⭐️ 9.0/10

OpenAI 预览了 Ultrafast——一个全新的 API 服务层级,可将 GPT-5.6 Sol 的推理速度提升至 14 倍,输出速度最高达每秒 750 个 token。该层级由 Cerebras 硬件驱动,面向寻求更低延迟推理的企业用户。 这一公告具有重要意义,因为它直接解决了推理延迟的问题,而延迟是实时应用和智能体工作流的关键瓶颈。更快的 token 生成能让 AI 智能体响应更及时,并可能使 OpenAI 的旗舰模型对企业部署更具吸引力。 Ultrafast 层级由 Cerebras 的晶圆级引擎技术驱动,该技术利用大尺寸芯片和片上 SRAM 来减少互连瓶颈。OpenAI 于 2026 年与 Cerebras 签署合作协议;Cerebras 的其他客户包括 G42 和 AWS。

rss · OpenAI News · 8月13日 10:00

背景: GPT-5.6 是 OpenAI 于 2026 年中期发布的最新前沿模型系列,包含 Sol、Terra 和 Luna 三个变体。Sol 是旗舰型“主力”模型,专为复杂推理、编程和智能体工作流而设计。Cerebras Systems 制造的晶圆级 AI 芯片比传统 GPU 大得多,有助于减少 AI 推理中的延迟和内存瓶颈。

参考链接

标签: #OpenAI, #API, #AI model, #performance, #Cerebras


Grok 4.6 重回第一梯队,低价反超 Fable 5 ⭐️ 9.0/10

xAI 于 2026 年 8 月 12 日发布 Grok 4.6,其基准测试表显示其在性能上超越或持平 GPT-5.6 Sol 和 Claude Fable 5 等竞品,且价格低于 Fable 5。据称该模型利用了马斯克旗下 SpaceX 近期收购的 AI 编程平台 Cursor 的数据。 这标志着 xAI 重返前沿 AI 竞赛,并以定价作为对抗 Anthropic 旗舰模型的关键差异化手段。收购 Cursor 的决策似乎得到了验证,使 xAI 在编程 AI 领域获得战略优势,直接影响开发者及更广泛的 AI 工具生态。 Grok 4.6 发布时附带了一个十行基准测试表,Digital Applied 的分析发现该表异常准确,31 个可公开核实的来源均正确引用。Grok 4.5 基于 1.5 万亿参数的 V9 基础构建,并已整合 Cursor 数据;SpaceX 对 Cursor 的收购估值达 600 亿美元,归入 SpaceXAI 子公司。

rss · QbitAI · 8月13日 12:04

背景: Grok 是 xAI 的 AI 聊天机器人系列,直接与 OpenAI 的 GPT 系列和 Anthropic 的 Claude 等模型竞争。Cursor 是 2022 年创立的 AI 编程编辑器,在被 SpaceX 于 2026 年 6 月收购前估值达 293 亿美元,ARR 超 30 亿美元。Anthropic 于 2026 年 6 月发布的 Claude Fable 5 专注于文档密集型任务和基于视觉的编程评估。这些模型的快速迭代和价格战正在塑造当前的 AI 格局。

参考链接

标签: #AI模型, #Grok, #定价, #Cursor, #xAI


Gemini 3.7 Flash 现已登陆 GitHub Copilot ⭐️ 9.0/10

2026 年 8 月 13 日,谷歌的 Gemini 3.7 Flash 模型开始向 GitHub Copilot 用户推出,在 Web 和应用开发以及智能体(Agentic)能力方面均有改进。 此次整合扩展了这一最广泛使用的开发者工具中的模型选择,让数百万开发者能够使用谷歌最新的编码模型。改进后的智能体能力有望带来更自主、更高效的编码工作流。 Gemini 3.7 Flash 是仅提前三周发布的 Gemini 3.6 Flash 的后续版本,谷歌称其为迄今在编码和智能体领域最智能的“工作马”级(workhorse)模型。它是一款原生多模态推理模型,稳定版 API 标识为 gemini-3.7-flash。

rss · GitHub Changelog · 8月13日 14:00

背景: GitHub Copilot 是微软推出的 AI 编程助手,拥有数百万开发者用户,并提供多家供应商的模型选择。Gemini Flash 系列是谷歌为兼顾速度、成本与能力而优化的高效模型系列,适用于大流量场景。智能体(Agentic)能力使 AI 能够自主拆解任务并执行多步骤工作流,而不仅仅是响应一次性提示。

参考链接

标签: #AI, #GitHub Copilot, #Gemini, #Developer Tools, #Model Release


DeepSeek 发布开源 Harness 工具,带 Web UI 界面 ⭐️ 8.0/10

DeepSeek 发布了 DeepSeek Harness(dsh)的开发者预览版,这是一个带 Web UI 的开源 agent harness,源代码已在 GitHub 上公开。该项目星标增长迅速(大约每几分钟增长 1k),且缓存命中率很高。 这标志着 DeepSeek 官方加大对开发者工具链的投入,为在其模型之上构建 agent 降低了门槛,可能惠及众多开发者和企业。基于插件的架构也可能使其成为 agent 开发的灵活标准。 DeepSeek Harness 基于 Cordis 插件系统构建,所有 agent 能力(模型、工具、技能、会话、沙箱、存储、循环、调度和 UI)均由插件提供。目前为开发者预览版,并提供文档与教程。

rss · V2EX Tech · 8月13日 13:42

背景: Agent harness(agent 编排框架)是将大语言模型与工具、记忆和执行环境连接起来,用于构建可投入生产的 AI agent 的框架。DeepSeek Harness 采用“一切皆插件”的架构,具备高度模块化和可扩展性。其底层插件系统 Cordis 由开发者 shigma 创建,插件之间通过服务和事件进行通信。该项目为开源项目,并包含用于管理 agent 工作流的 Web UI。

参考链接

标签: #DeepSeek, #AI tools, #developer tools, #GitHub, #caching


DeepSeek 发布 V4 Pro 正式版,API 价格分时段大幅上调 ⭐️ 8.0/10

DeepSeek 正式发布 deepseek-v4-pro,并调整 API 价格,引入高峰时段(北京时间 9:00–12:00、14:00–18:00)与空闲时段计费。v4-pro 高峰时段缓存命中输入价格最高上涨 1100%,新价格自北京时间 2026 年 8 月 17 日 00:00 起生效。 大幅涨价,尤其是 v4-pro 高峰时段缓存命中输入价格上调 1100%,将直接提高开发者的 AI 推理成本,并增加成本规划难度。随着 DeepSeek 推出 1.6T 参数的 Pro 模型,这标志着其从低价推广转向商业化变现。 在高峰/空闲分时计价下,deepseek-v4-flash 的高峰价格同样上涨:缓存命中输入涨至每百万 tokens 0.10 元(+400%),缓存未命中输入涨至 3.0 元(+200%),输出涨至 9.0 元(+350%)。空闲时段价格虽较低,但仍高于调价前,例如 v4-pro 缓存命中输入为每百万 tokens 0.15 元(+500%)。

rss · V2EX Tech · 8月13日 11:55

背景: 根据 Hugging Face 模型卡,DeepSeek-V4-Pro 是一个混合专家(MoE)模型,总参数 1.6 万亿,激活参数 49B,支持 100 万 tokens 上下文窗口;DeepSeek-V4-Flash 总参数 284B,激活参数 13B。API 对缓存命中输入、缓存未命中输入和输出分别计费,缓存命中因复用已计算上下文而更便宜。这些新的国内(人民币)价格随 v4-pro 正式版发布,自北京时间 2026 年 8 月 17 日起生效。

参考链接

标签: #DeepSeek, #AI API, #pricing, #LLM, #developer tools


谷歌正在输掉 AI 竞赛吗?Decoder 剖析 DeepMind 重组 ⭐️ 8.0/10

《The Verge》的 Decoder 播客邀请资深 AI 记者 Hayden Field,讨论谷歌是否正在输掉 AI 竞赛。这期节目围绕上周谷歌对 Google DeepMind 进行的大规模重组展开,重组涉及首席科学家 Jeff Dean。 这件事很重要,因为谷歌的 AI 战略直接关系到众多工程师依赖的 Google Cloud AI 和开发者工具。这场讨论对 DeepMind 重组究竟是战略退缩还是重整旗鼓、继续与 OpenAI 和微软竞争,提供了可信的行业解读。 这期节目属于分析与评论,而非产品发布,重点讨论组织架构、领导角色和竞争定位。Hayden Field 以记者的视角审视谷歌是否在 AI 竞赛中掉队。

rss · The Verge AI · 8月13日 14:10

背景: Google DeepMind 由 DeepMind 与 Google Brain 合并而来,Jeff Dean 担任谷歌首席科学家。近年来,谷歌、OpenAI、微软等围绕大语言模型展开的 AI 竞赛日益激烈,相关产品包括 Gemini、ChatGPT 和 Copilot。

标签: #Google, #AI, #DeepMind, #industry analysis, #podcast


深度体验 DeepSeek Harness,我原谅它涨价了 ⭐️ 8.0/10

深度评测新开源的 DeepSeek Harness,涵盖其插件优先的 Cordis 架构、智能体预设、轨迹回放,以及在长时任务与 token 消耗控制上的表现。

rss · BestBlogs.dev · 8月13日 16:03

标签: #DeepSeek, #AI Agent, #Open Source, #Developer Tools, #Agent Harness


Claude Code v2.1.232:默认子代理分叉、跨会话消息与 GitLab 令牌脱敏 ⭐️ 7.0/10

Claude Code v2.1.232 默认启用子代理分叉,使分叉子代理继承完整对话与提示缓存,并支持在提示中输入 @ 提及另一个会话,从而通过 SendMessage 直达该会话。此版本还新增了对 GitLab 令牌系列的红 action(脱敏)、GitLab 插件市场支持、新的配置别名,并修复了多个权限绕过问题。 此更新使多会话协作和并行子代理执行对开发者更加无缝,通过共享提示缓存降低输入令牌成本,并通过 GitLab 令牌红 action 与权限绕过修复增强安全性。对于在大型代码库或 CI/CD 流水线中使用 AI 编码代理的团队来说,这一点直接相关。 GitLab 令牌红 action 覆盖 glrt-、gloas-、glptt-、glagent-、glimt-、glsoat-、glcbt-、glft- 和 glffct- 前缀,并对可路由的 glpat-/gldt- 令牌进行完全红 action。交互式会话中的非队友代理生成现在默认在后台运行,交互式会话会获得唯一的 name-word-word 名称以避免冲突。

rss · Claude Code Releases · 8月13日 23:29

背景: 在 Claude Code 中,子代理分叉(subagent forking)允许 subagent_type 为 'fork' 的子代理从父代理继承完整对话和提示缓存,使并行子代理能共享缓存的提示前缀,从而将后续子代理的输入令牌成本降低多达 90%。提示缓存是一种将 LLM 对长而静态的提示前缀的处理结果进行存储和复用的技术,可降低延迟和成本。跨会话消息传递(通过 SendMessage 工具引入)允许一个 Claude Code 会话列出并给同一台机器上的其他活动会话发消息,这对协调多代理工作流很有用。这些功能是 Claude Code 作为代理式编码工具不断演进的组成部分,日益支持复杂的并行开发工作流。

参考链接

标签: #Claude Code, #AI coding agent, #release notes, #developer tools, #Anthropic


Writer 推出基于 GLM-5.2 的 AI 模型,配备降本 harness ⭐️ 7.0/10

Writer 发布了一款新 AI 模型,它是 Z.ai 开源模型 GLM-5.2 的后训练变体,并升级了配套的 harness(部署支架),旨在降低 token 成本的同时保持可部署的能力。 这很重要,因为 token 成本是开发者构建 AI 功能的主要障碍;Writer 的产品为获得可部署性能提供了更实惠的途径。这也突显了商业供应商基于开源模型构建的日益增长的趋势。 GLM-5.2 支持 100 万 token 的上下文窗口和最高 131,072 个输出 token,并采用 MIT 开源许可。升级后的 harness 可能应用了语义压缩、基于检索的上下文管理等技术,这些技术可在对输出质量影响最小的情况下将成本降低 50%-99%。

rss · TechCrunch AI · 8月13日 21:13

背景: 'Agent harness'是包裹 AI 模型的基础设施层,用于管理其生命周期、上下文、工具访问、验证和生产环境中的安全性。Token 成本是 LLM 提供商按 token 收取的费用,在长上下文或复杂任务中会迅速增加。Writer 基于 Z.ai 的 GLM-5.2(领先的开源模型)提供高性价比的 AI。许多开发者现在采用 token 削减策略来让 AI 代理更实惠。

参考链接

标签: #AI model, #token costs, #Writer, #GLM-5.2, #cost efficiency