Horizon 每日速递 - 2026-07-17

从 98 条内容中筛选出 12 条重要资讯。


  1. Kimi K3 推高开放模型标准, pelican 测试仍有启示 ⭐️ 9.0/10
  2. Thinking Machines Lab 发布 975B 参数 Inkling 开放权重模型 ⭐️ 9.0/10
  3. Claude Code v2.1.212 增加后台分叉与安全限制 ⭐️ 8.0/10
  4. Codex 漏洞可能在无沙箱全权限下删除文件 ⭐️ 8.0/10
  5. Claude 可使用 1Password 凭据完成浏览器任务 ⭐️ 8.0/10
  6. 欧盟要求谷歌向竞争对手开放安卓和搜索 ⭐️ 8.0/10
  7. Google AI Mode 新增应用连接以直接完成任务 ⭐️ 8.0/10
  8. Vercel 运行时日志现可显示缓存原因 ⭐️ 8.0/10
  9. MySQL 降序主键触发 index_merge 查询异常 ⭐️ 7.0/10
  10. Codex 0.144.5 扩大危险命令检测范围 ⭐️ 7.0/10
  11. Codex 新增自定义 Amazon Bedrock 传输支持 ⭐️ 7.0/10
  12. Xcode 27 运行器映像进入 GitHub Actions 公开预览 ⭐️ 7.0/10

Kimi K3 推高开放模型标准, pelican 测试仍有启示 ⭐️ 9.0/10

Moonshot AI 宣布了拥有 2.8 万亿参数的 Kimi K3,目前可通过其网站和 API 使用,并承诺在 2026 年 7 月 27 日前发布开放权重。Moonshot AI 称其为首个“3 万亿级开放模型”,而报告中的评测显示它接近或超过了多款领先的闭源模型。 Kimi K3 扩大了未来可供自行部署的模型在规模和能力上的上限,同时通过 API 为开发者提供了领先闭源系统之外的中国模型选择。它的定价、据称的编程表现以及开放权重发布计划,可能加剧模型 API 和开放权重生态之间的竞争。 Kimi K3 的 API 价格为每百万输入令牌 3 美元、每百万输出令牌 15 美元,明显高于 Kimi K2.6 的 0.95 美元和 4 美元;Artificial Analysis 报告称其单任务成本为 0.94 美元,输出令牌数比 K2.6 少 21%。在“骑自行车的 pelican” SVG 测试中,模型使用了 16,658 个输出令牌,成本约为 0.25 美元;根据图像生成描述的成本约为 0.006 美元,但该测试和 Moonshot 的对比不能替代广泛的独立评测。

rss · Simon Willison · 7月16日 20:19

背景: 模型参数是决定模型许多行为的已学习数值,因此 2.8 万亿参数代表了极大的模型规模,但参数数量本身不能证明模型质量或运行成本。开放权重发布意味着其他人可以获得训练后的参数权重并尝试检查或运行模型,但这不一定表示训练数据、代码或许可证也完全开放。pelican 基准要求模型生成一幅“骑自行车的 pelican” SVG 图像,同时考察代码生成、空间推理、解剖理解和创意组合能力。

参考链接

标签: #AI models, #Moonshot AI, #Open weights, #Model APIs, #LLMs


Thinking Machines Lab 发布 975B 参数 Inkling 开放权重模型 ⭐️ 9.0/10

Thinking Machines Lab 发布了 Inkling,这是一款采用 Mixture-of-Experts 架构的多模态 Transformer,总参数量为 9750 亿、激活参数量为 410 亿,并采用 Apache-2.0 许可证。该模型使用了 45 万亿个文本、图像、音频和视频词元进行训练,而计划中的 2760 亿参数 Inkling-Small 仍未发布。 此次发布为开放权重生态增加了一个重要的美国模型,并为开发者提供了一个采用宽松许可证、可用于定制和部署的多模态基础模型。Inkling 通过 Tinker 微调平台提供服务,可能加快专用人工智能应用的开发,但其极大的总规模仍可能带来高昂且复杂的部署成本。 Inkling 被明确定位为用于微调的强大基础模型,而不是当前最强的前沿模型,其主要特点包括多模态能力、高效思考和 Tinker 支持。该模型卡和训练数据文档异常简短,只说明训练使用了来自公开互联网和第三方的数据,其中可能包含受知识产权保护的内容。

rss · Simon Willison · 7月16日 15:35

背景: Mixture-of-Experts 模型包含许多专家参数组,但每个词元只会经过其中一部分,因此总参数量和激活参数量反映的是模型规模的不同方面。对 Inkling 而言,975B 表示所有专家参数的总量,而 41B 表示特定处理路径实际使用的参数量。多模态模型能够处理文本、图像、音频和视频等多种数据类型,而不只是文本。开放权重表示模型参数可供获取,但具体的使用、修改和再分发方式仍由许可证决定。

参考链接

标签: #Open-weights models, #Multimodal AI, #Mixture-of-Experts, #AI infrastructure, #Model licensing


Claude Code v2.1.212 增加后台分叉与安全限制 ⭐️ 8.0/10

Claude Code v2.1.212 将 /fork 改为创建独立的后台会话,而原先在当前会话中启动子代理的行为改由 /subtask 提供。该版本还加入自动模式重置、每个会话默认 200 次 WebSearch 调用和 200 次子代理生成上限、超过两分钟的 MCP 调用自动转入后台,以及用于恢复历史会话的选择器。 这些变化让开发者更容易管理并行代理任务,同时降低搜索循环或委派循环失控并消耗过多资源的风险。长时间运行的 MCP 操作会自动转入后台,也能保持交互式会话可用,这对依赖 AI 编程代理和外部工具的开发者很有价值。 WebSearch 和子代理上限分别可通过 CLAUDE_CODE_MAX_WEB_SEARCHES_PER_SESSIONCLAUDE_CODE_MAX_SUBAGENTS_PER_SESSION 调整,/clear 会重置子代理预算;MCP 自动后台运行可通过 CLAUDE_CODE_MCP_AUTO_BACKGROUND_MS 配置或禁用。该版本还修复了计划模式未经许可修改文件、提交到仓库的符号链接导致工作树越界、SIGTERM 未清理进程树,以及 Windows、钩子、会话恢复和 /ultrareview 等问题。

rss · Claude Code Releases · 7月17日 00:26

背景: MCP 将 AI 代理的主机或客户端与提供工具和服务的外部 MCP 服务器区分开来。长时间运行的 MCP 操作可能会占用代理交互,因此后台执行采用类似“先调用、后获取结果”的异步模式。在 Claude Code 中,/fork 和后台会话允许用户继续工作并让另一会话独立运行,而子代理则负责执行代理流程委派的任务。

参考链接

标签: #Claude Code, #AI 编程代理, #MCP, #开发者工具, #会话管理


Codex 漏洞可能在无沙箱全权限下删除文件 ⭐️ 8.0/10

Thibault Sottiaux 表示,OpenAI 调查了多起 GPT-5.6 意外删除文件的报告。该问题最常见于 Codex 以全权限运行、未启用沙箱或自动审查时:模型尝试覆盖$HOME,却错误地删除了用户真实的主目录。 拥有未受沙箱保护的完整文件系统权限的编码代理,可能把模型错误变成破坏性的数据丢失,影响源代码、文档和配置文件。该事件再次说明,AI 开发工具需要沙箱、操作审批机制以及最小权限的文件系统访问控制。 据报道,该故障由多项条件共同触发:启用全权限、关闭沙箱保护、关闭自动审查,以及错误处理临时$HOME 覆盖。现有信息说明了原因和常见触发方式,但没有说明补丁、受影响的平台,或文件删除后能否恢复。

rss · Simon Willison · 7月16日 17:45

背景: Codex 是一种 AI 编码代理,可以在开发者的计算机上执行命令和修改文件。沙箱会限制这些命令能够访问的资源,而自动审查或审批机制则可在高风险操作执行前提供额外检查。在类 Unix 系统中,$HOME 表示用户的主目录,因此如果把临时替代值与真实值混淆,破坏性命令就可能作用于个人文件。

参考链接

标签: #Codex, #coding-agents, #AI-safety, #developer-tools, #filesystem-security


Claude 可使用 1Password 凭据完成浏览器任务 ⭐️ 8.0/10

1Password 推出了与 Claude 配合使用的浏览器集成,用户可以授权聊天机器人使用已保存的用户名、密码和一次性验证码。随后,Claude 可以代办旅行预订或管理在线账户等多步骤任务,而无需用户手动输入登录信息。 这项集成让 AI 代理更接近代表用户处理需要身份验证的现实工作流程,可能提升浏览器自动化的实用性。同时,它也让授权控制、隐私保护以及防止误操作变得更加重要。 凭据访问权限仅限于当前任务,并会在任务完成后结束。1Password 填入登录信息后会检查凭据是否暴露在页面上;如果提交失败,它会在交还控制权前清除已填入的内容。

rss · The Verge AI · 7月16日 13:00

背景: 基于浏览器的 AI 代理可以浏览网站并执行多个连续步骤,但许多实用任务都需要先登录。密码管理器负责保存登录信息,并将其填入网站。通过这项集成,Claude 发起访问请求,1Password 提供凭据,从而让实际密码与代理的其他操作流程保持隔离。

参考链接

标签: #Claude, #AI代理, #1Password, #浏览器自动化, #安全与隐私


欧盟要求谷歌向竞争对手开放安卓和搜索 ⭐️ 8.0/10

欧盟依据《数字市场法》要求谷歌向竞争性的人工智能助手和搜索引擎提供更广泛的安卓系统及谷歌搜索访问权限。相关要求包括开放 11 项安卓系统功能,并向竞争服务提供匿名化的搜索查询和点击数据。 这些决定可能削弱谷歌对安卓分发渠道和搜索数据的控制,为竞争性助手和搜索引擎提供更多发展机会。此举也可能加快欧洲移动操作系统与替代性人工智能服务之间的互操作。 竞争对手预计将获得与谷歌 Gemini 助手目前可用功能相当的访问权限,而搜索竞争者将获得匿名化的查询和点击信息。这些义务源于《数字市场法》,重点是互操作和数据访问,并不要求谷歌放弃安卓或搜索业务。

rss · The Verge AI · 7月16日 12:06

背景: 《数字市场法》是欧盟制定的一项法规,旨在通过要求被认定为“看门人”的大型平台承担特定义务,让数字市场更加公平并提高可竞争性。互操作性意味着外部服务能够使用平台的相关功能,而不是只能使用平台所有者自己的产品。在本案中,相关规则针对安卓功能以及部分谷歌搜索数据,以帮助竞争性人工智能助手和搜索引擎参与竞争。

参考链接

标签: #EU regulation, #Google, #Android, #AI interoperability, #Digital Markets Act


Google AI Mode 新增应用连接以直接完成任务 ⭐️ 8.0/10

Google AI Mode 不再局限于回答问题,而是开始连接部分应用,让用户能够通过人工智能驱动的搜索与这些应用互动并完成任务。据报道,相关应用包括 Instacart、Canva 和 YouTube Music,但目前支持的应用列表和功能仍然有限。 这项更新推动 Google Search 从提供信息向主动协助用户完成任务转变。它可能影响软件生态中人工智能代理、应用集成以及面向消费者的生产力体验的设计方式。 这些集成目前似乎主要支持购物、设计和音乐等特定场景,而不是让 AI Mode 不受限制地控制所有已连接应用。实际影响将取决于支持哪些应用、每个集成允许执行哪些操作,以及是否需要用户逐步确认。

rss · TechCrunch AI · 7月16日 16:00

背景: AI Mode 是 Google 推出的人工智能驱动搜索体验,应用集成则是把搜索界面与外部服务连接起来。人工智能代理是能够代表用户追求目标并完成任务的软件系统,因此这项更新体现了搜索产品从生成答案向通过已连接应用执行操作的转变。

参考链接

标签: #Google AI, #AI agents, #App integrations, #Productivity, #Search


Vercel 运行时日志现可显示缓存原因 ⭐️ 8.0/10

Vercel 运行时日志现在会说明可缓存响应为何没有命中新鲜缓存,包括冷启动未命中、绕过缓存、返回过期内容以及重新验证事件。缓存原因可在“日志”选项卡中查看,也可通过 vercel logsvercel metrics 和 Vercel 插件的 CDN 缓存技能获取。 这为 Next.js 团队提供了有关 ISR、PPR、CDN 和函数缓存行为的可操作可见性,更容易诊断缓存未命中并提升命中率和响应延迟。它还可以帮助团队区分正常的重新验证、错误以及由配置触发的缓存绕过。 该功能适用于可由 CDN 缓存的响应,例如 ISR、部分预渲染,以及设置包含 stale-while-revalidate 等指令的 Cache-Control 标头的函数;每次请求都动态渲染的响应不会显示缓存原因。具体原因包括冷缓存、请求合并或错误导致的未命中,草稿模式、预渲染绕过或爬虫导致的绕过,基于时间的重新验证、基于标签的失效、重新验证错误以及基于标签的删除。

rss · Vercel Blog · 7月17日 01:00

背景: 增量静态再生(ISR)允许 Next.js 在运行时生成或更新静态页面,而不必因每次内容变化都重新构建整个网站。部分预渲染(PPR)结合静态渲染和动态渲染,使静态外壳可以先提供给用户,同时单独生成动态部分。HTTP 的 Cache-Control 标头用于定义浏览器和 CDN 等共享缓存的缓存行为,而 stale-while-revalidate 可以允许缓存先提供过期内容,同时获取新响应。

参考链接

标签: #Vercel, #Next.js, #Caching, #Observability, #CDN


MySQL 降序主键触发 index_merge 查询异常 ⭐️ 7.0/10

一次排查发现,t_invoice 中明明存在 statusPASSED 的记录,等值条件查询却返回空结果。执行计划显示查询使用了 index_mergeUsing intersect,改用 LIKE 或关闭 index_merge 后均能正常返回三条记录。 这个案例表明,查询优化器异常可能导致的并不只是性能下降,还可能是错误的查询结果。它提醒 MySQL 运维和后端工程师关注不寻常的索引设计与 index_merge 行为,并在生产排障时检查执行计划、使用针对性的优化器提示。 该表同时存在 PRIMARY KEY (id DESC, status)idx_bizidx_statusidx_biz_status;通过 NO_INDEX 模拟禁用索引发现,屏蔽 idx_status 后查询会正确使用复合索引,而屏蔽 idx_biz_status 仍会进入异常的交集路径。排查还用 HEX 检查了 status 的真实字节并排除了隐藏字符,但材料没有给出明确的 MySQL 版本或官方修复补丁。

rss · V2EX Tech · 7月17日 00:30

背景: MySQL 的 index_merge 是一种访问方式,它会合并同一张表上的多个索引扫描结果,并可对行标识执行并集或交集操作。这个案例中,优化器分别扫描 biz_idstatus 索引后取交集,而较宽松的查询则直接使用引用查找。降序索引会按降序保存键值,把自增列放在降序主键的首列并不常见;文章指出,这还可能使插入集中发生在 B+树前端。

参考链接

标签: #MySQL, #查询优化器, #索引, #index_merge, #数据库排障


Codex 0.144.5 扩大危险命令检测范围 ⭐️ 7.0/10

OpenAI Codex CLI 0.144.5 改进了危险命令检测,覆盖更多强制删除形式的 rm 命令。命令被拒绝时,工具还会提供更清晰的原因,相关修改记录在拉取请求 #33455 中。 这项更新降低了 AI 编程代理误放行或执行破坏性文件删除命令的风险。更清晰的拒绝提示也能帮助开发者理解操作被阻止的原因,并更安全地调整请求。 这是一次针对命令安全逻辑的专门修复,而不是大范围功能更新;更新日志没有列出所有新增覆盖的命令形式。在类 Unix 系统中,rm 用于删除文件或目录,-f 以及 -rf 等强制或递归选项可能跳过提示并删除目录内容。

rss · OpenAI Codex Releases · 7月16日 02:56

背景: Codex CLI 在编程任务中可以与 shell 命令交互,因此需要识别可能造成不可逆更改的操作。rm 是 Unix 系统中用于删除文件和目录的标准命令。它的强制和递归选项会让删除操作更加激进,因此安全检查需要识别多种命令写法。

参考链接

标签: #OpenAI Codex, #AI 编程代理, #命令安全, #开发者工具


Codex 新增自定义 Amazon Bedrock 传输支持 ⭐️ 7.0/10

Codex v0.144.4 允许内置的 Amazon Bedrock 提供商在 AWS 配置文件和区域之外,覆盖基础网址、认证方式和 HTTP 请求头。它支持基于命令的持有者令牌认证以及自定义端点,并且不会对这些请求应用 AWS 请求签名,同时保留默认配置的区域端点解析行为。 这让 Codex 更容易部署在企业代理、自定义 Bedrock 兼容端点或外部管理的认证系统之后。团队可以继续使用内置提供商,同时将传输方式适配到不采用标准 AWS 签名的基础设施。 该版本将 Bedrock 账户中的 credentialSource 枚举替换为 usesCodexManagedCredentials 布尔值,以统一报告基于命令认证及其他外部管理的配置。测试覆盖配置合并与校验、带自定义请求头的命令认证代理请求,以及托管凭据和外部凭据的账户报告。

rss · OpenAI Codex Releases · 7月16日 21:41

背景: Amazon Bedrock 是 AWS 用于构建生成式人工智能应用和代理的平台。在标准 AWS 流程中,请求可以使用第 4 版签名,即 SigV4,通过签署 API 请求来完成认证并保障完整性。自定义传输则可以将请求发送到配置的端点,并使用持有者令牌认证和指定的 HTTP 请求头。

参考链接

标签: #Codex, #Amazon Bedrock, #AWS, #Authentication, #Developer Tools


Xcode 27 运行器映像进入 GitHub Actions 公开预览 ⭐️ 7.0/10

GitHub 托管的 macOS 运行器现已公开预览支持 Xcode 27 映像,开发者可以在 GitHub Actions 中构建和测试 Apple 应用。该映像可通过 GitHub 提供的 Xcode 27 运行器配置使用。 这让 Apple 开发团队能够更早通过云端持续集成和测试使用最新的 Xcode 工具链,有助于提前验证应用流水线。不过,该功能仍处于公开预览阶段,团队在生产环境中依赖它时需要保持谨慎。 Xcode 27 映像目前仅适用于 arm64 macOS 运行器,不支持 Intel 运行器。与较早的运行器映像相比,它包含不同的工具及工具版本,因此现有工作流可能需要重新验证或调整。

rss · GitHub Changelog · 7月16日 18:00

背景: GitHub 托管的运行器是由 GitHub 提供的虚拟机,用于执行 GitHub Actions 工作流中的构建和测试任务。运行器映像会预装操作系统和开发工具,工作流可以通过映像标签选择 macOS 等环境。Xcode 是 Apple 用于构建和测试 Apple 应用的开发工具链。

参考链接

标签: #GitHub Actions, #Xcode, #macOS CI, #Apple 开发, #DevOps