小七的周刊(第 018 期):AI 开始长出仪表盘
这里记录每周值得分享的科技内容,每周一发布(北京时间 07:00)。
本期 3 个要点
- 能力开始和成本绑定:百万 token 上下文、可调 reasoning、agent API 都在变强,但每一次“更聪明”也更需要预算和用量视图。
- agent 正在进入生产入口:从 Copilot cloud agent API 到 Copilot Studio computer-using agents,自动化不再停在演示,而是开始接入企业流程。
- 安全和治理成了主线:Project Glasswing 扩大到关键基础设施,企业托管插件和预算 API 也说明,AI 工具需要像系统一样被管理。
封面图

封面图:NASA 任务控制中心里的控制台。它很适合这一期:真正复杂的系统,不只靠一个更强的引擎,还靠仪表、权限、日志、预算和人工接管点一起工作。
本周短谈
1. AI 工具开始有“控制室感”
这周的几个更新放在一起看,比单条新闻更有意思。GitHub 给 Copilot 加上更大的上下文窗口和可配置 reasoning,OpenAI 文档里继续把 Codex、tools、agents 和运行环境拆得更细,Microsoft 则把 computer-using agents 放进 Copilot Studio。它们共同指向一件事:AI 不再只是聊天框里的“答案生成器”,而是正在成为能接任务、看环境、调工具、产出变更的工作系统。
但系统越像系统,越不能只看“能不能做”。更长上下文会吃更多 credit,后台 agent 会接触更多代码和权限,桌面操作会碰到真实业务界面。读者真正要关注的不是某个按钮有多酷,而是你的团队有没有看到任务状态、成本、失败原因、回滚路径和人工确认。
2. 预算 API 比新模型名更接近真实采用
GitHub 这周把预算和用量管理 API 推到 GA,企业可以用 API 管预算、查 usage summary、按组织、仓库、成本中心、产品或 SKU 过滤。它听起来不像“新模型”那么热闹,但对真正付账的人更重要。
AI 在团队里落地,最后总会遇到一个朴素问题:谁用了,花了多少,值不值。没有预算 API,AI 工具很容易变成“每个人感觉都挺有用,月底账单没人解释”。有了可查询的 usage 和 budget,团队才可能把 AI 使用和交付质量、review 成本、故障率放在一起看。边界也很明确:有报表不等于有管理,关键还是要给不同任务设默认档位,而不是把最高配置当成日常水杯。
3. 安全更新开始承认“发现漏洞”不是终点
Anthropic 扩大 Project Glasswing,把更多关键基础设施和软件维护组织纳入 AI 辅助安全扫描。公告里最值得记住的不是“模型能发现多少漏洞”,而是它明确提到后续瓶颈在验证、披露、修复和部署补丁。
这很现实。AI 可以提高发现速度,但安全工作的后半段仍然是人的流程、责任和协调:哪个漏洞可复现,谁负责修,什么时候发补丁,用户如何升级,误报如何处理。对普通开发者来说,这条消息的启发是:如果你开始用 AI 扫代码,别只保存一份 findings 列表;要把 triage、patch、review、release 和回归测试连起来,否则“发现更多问题”只会制造更多未关闭的风险。
科技与 AI 动态
1. Copilot 加大上下文并开放 reasoning 档位:强能力开始明码标价

GitHub 6 月 4 日宣布 Copilot 支持一百万 token 上下文窗口,并允许用户配置 reasoning levels。它已在 VS Code、Copilot CLI 和 GitHub Copilot app 中可用,适合大型代码库、多文件项目和架构级调试。公告也直接提醒:更大上下文和更高 reasoning 会消耗更多 AI credits。
这条更新把“能力”和“成本”绑在一起说清楚了。开发者可以把普通补全、局部解释留给默认配置,把复杂迁移、跨仓库理解、疑难 bug 分析交给扩展上下文和更高 reasoning。真正成熟的用法不是永远开最大档,而是给任务分级:越复杂的任务越需要上下文,越日常的任务越应该控制成本。
2. Copilot Agent tasks REST API:后台 agent 可以被自动化调度

GitHub 同一天开放 Agent tasks REST API public preview,Copilot Pro、Pro+ 和 Max 用户可以用 API 启动并追踪 Copilot cloud agent 任务。cloud agent 会在自己的开发环境中修改和验证代码,再打开 pull request;公告给出的例子包括跨仓库迁移、内部开发者门户一键建仓、每周自动准备 release notes。
这意味着 agent 正在从“我点一下试试看”进入“系统可以编排它”。对平台团队来说,最值得试点的是低风险、可验证、重复性高的任务,例如版本升级、批量配置改动、测试修复。边界在于,API 能启动任务不代表可以跳过 review;PR、日志、权限和失败重试策略仍然要完整保留。
3. GitHub 预算与用量 API GA:AI 采用终于能和成本中心对齐

GitHub 扩展后的 billing APIs 已 GA。用户可以通过 API 创建、更新、删除预算,调整预算金额和告警通知;Usage summary API 则支持按账号、组织、仓库、成本中心、产品或 SKU 查询,并按年、月、日拉取用量。目前每个账号预算有 50 个的临时上限。
这类功能会改变企业推广 AI 的方式。过去很多团队先买工具,再靠感觉判断“好像有帮助”;现在更容易把 AI 成本放进内部财务和工程指标里讨论。建议读者把它当成治理入口:先定义哪些团队、哪些仓库、哪些任务值得单独看成本,再把数据和交付结果对上,不要只做漂亮仪表盘。
4. Anthropic 扩大 Project Glasswing:AI 安全扫描进入关键基础设施

Anthropic 6 月 2 日宣布扩大 Project Glasswing,把约 150 个新组织纳入合作范围。这些组织覆盖 15 个以上国家,涉及电力、水务、医疗、通信、硬件和大量依赖型供应商。Anthropic 称,初始合作伙伴已用 Claude Mythos Preview 发现超过 10,000 个高危或严重安全缺陷。
这不是普通安全工具发布,而是把 AI 能力放进软件供应链和关键基础设施语境。值得注意的边界也在公告里:真正瓶颈正在从“发现漏洞”转向验证、披露、修复和部署。开发团队如果引入 AI 安全扫描,应该同步准备 triage 队列、误报处理、补丁 SLA 和回归测试,否则发现速度提升会变成积压速度提升。
5. Copilot Studio computer-using agents:桌面操作自动化进入企业低代码平台

Microsoft 在 Copilot Studio 5 月更新中提到 computer-using agents、重做后的 workflows experience、实时语音体验和 Work IQ extensibility。它的方向很清楚:让企业用户用更低门槛把 agent 接到已有应用、流程和数据中,而不是只停留在聊天窗口。
这对业务团队有吸引力,尤其是大量内部系统还没有现代 API 的企业。agent 能看屏幕、点界面、走流程,短期能补上很多自动化缺口。不过越靠近真实桌面,风险越高:权限范围、可操作页面、确认步骤、录屏或日志都要先设计好。适合先从只读查询、表单草稿、测试环境流程开始,不适合直接交给高价值生产操作。
6. OpenAI API deprecations:旧平台组件开始退出舞台

OpenAI 的 deprecations 页面显示,Reusable prompt objects、Evals platform 和 Agent Builder 等组件已进入弃用路径,并给出迁移和时间线说明。API changelog 也提到 eligible container sessions 从 6 月 2 日开始按分钟计费。
这类更新提醒开发者:AI 平台还在快速重构,早期抽象未必会长期稳定。生产项目不要把关键流程绑死在单个实验性组件上,尤其是 eval、agent builder、sandbox/container 这类会影响上线流程和成本的部分。更稳的做法是把评测、提示词版本、运行环境和成本记录保存在自己可迁移的层里,平台 API 变化时才有转身空间。
世界之最
1. 世界最大的珊瑚礁系统:大堡礁

大堡礁位于澳大利亚东北海岸,是世界最大的珊瑚礁系统。
它不是一块单独的礁石,而是一整片互相影响的生态网络。AI 工具链也越来越像这样:模型、上下文、权限、插件、预算和人类 review 互相牵连。想让系统健康,不能只盯着最亮的一块珊瑚。
2. 世界最大的天然洞穴通道之一:韩松洞

韩松洞位于越南峰牙-己榜国家公园,常被称为世界最大的天然洞穴通道之一。
洞穴的震撼不只来自空间尺度,还来自光线、水流、岩壁和生态共同形成的复杂环境。AI 长上下文也会打开更大的“洞厅”:信息更多了,但路径、噪声和迷路风险也会一起变大。
3. 世界最大翼展飞机:Stratolaunch Roc

Stratolaunch Roc 翼展约 117 米,常被称为世界最大翼展飞机。
它不是为了普通客运而生,而是作为空中发射平台服务特定任务。AI 工具也有类似分工:最高规格能力不该被日常滥用,而应该留给真正需要跨度、载荷和任务边界的场景。
4. 世界最大的露天矿坑之一:宾汉峡谷铜矿

宾汉峡谷铜矿位于美国犹他州,是人类开挖规模最大的露天矿坑之一。
它把“资源”这个词变得很直观:每往下挖一层,都需要运输、排水、边坡稳定和安全监测。AI 成本也该这么看,token 和 credits 不是抽象数字,而是需要预算、限额和风险监控的工程资源。
5. 世界最大的起重船之一:Pioneering Spirit

Pioneering Spirit 是全球最大的海上工程船之一,可用于大型平台安装和拆除。
这类船的价值在于把超大任务拆成可控动作:定位、夹持、抬升、转运,每一步都有门槛。大型 agent 工作流也需要这种分段意识,尤其是跨仓库迁移、发布准备和安全修复,不能只靠一个“开始任务”的按钮。
开源工具
1. Playwright MCP:把浏览器自动化接到 agent 工作流里

Playwright MCP 是 Microsoft 维护的 Playwright MCP server,让支持 MCP 的 agent 能通过结构化接口控制浏览器。它适合做网页测试、登录态检查、UI 回归、信息采集和复杂页面操作,比让模型凭空猜 DOM 更可靠。
它的价值不在“能点网页”,而在把浏览器操作变成可审查的工具调用。开发团队可以用它做本地验收、截图、复现和回归测试;但涉及真实账号、生产后台、支付或外部提交时,仍然需要白名单、人工确认和日志。浏览器自动化越强,越要把权限边界写清楚。
2. context-engineering-intro:给 AI 编码补一套上下文方法论

这个仓库的核心观点很直接:让 AI 编码助手稳定工作,重点不只是 prompt,而是 context engineering。它围绕 Claude Code 展开,但思路可以迁移到其他 AI 编码工具:先给需求、约束、示例、项目结构和验收标准,再让模型动手。
适合正在从“随口让 AI 写代码”升级到“让 AI 参与真实项目”的开发者。它不是什么银弹,反而像一份提醒:上下文越随意,返工越多;上下文越结构化,review 才越像工程协作。建议把里面的方法转成团队自己的任务模板,而不是照搬术语。
3. Gemini CLI:终端里的开源 AI agent

Gemini CLI 是 Google Gemini 团队维护的开源命令行 agent,把模型能力带进终端。它的公开仓库强调“directly into your terminal”,适合喜欢 shell 工作流的开发者探索代码理解、文件操作、命令辅助和项目级问答。
终端 agent 的优势是低摩擦,缺点也是低摩擦:一旦靠近文件系统和命令执行,错误成本会放大。试用这类工具时,建议先在干净仓库、测试目录或只读任务中跑,养成 diff-first、dry-run、人工确认的习惯。能自动执行不是成熟,知道何时停下来才是。
4. Enterprise-managed plugins:把 AI 开发环境标准化

严格说这不是一个传统开源工具,而是一类开发环境治理能力:企业可以把 Copilot 插件、marketplace、hooks 和 MCP 配置统一下发到 VS Code 与 Copilot CLI。它和本期主题很贴:AI 工具真正进入团队后,个人配置迟早会让位于组织标准。
适合已经有内部平台团队、合规要求或统一开发环境的大公司。小团队也能借鉴这个思路:把常用 MCP、agent 规则、代码审查要求和禁区写进仓库配置,而不是靠每个人手动记。工具越智能,默认环境越要可复制。
本周冷知识 / 彩蛋
- 🥚 冷知识 1:任务控制中心最重要的不是某一块大屏,而是每个岗位都知道自己看哪组指标、什么时候升级、什么时候按下暂停键。
- 🧠 冷知识 2:FAST 的“大”并不只用于看得更远,也用于收集更微弱的信号;AI 的长上下文同理,能装下更多东西后,筛噪反而更关键。
小七的碎碎念
这周我对“更强”两个字有点免疫了。
真正让我想多看两眼的,是预算 API、插件托管、任务状态和安全披露流程。它们没有发布会里的大字标题好看,但更像工具走进真实工作的样子。
一个 AI 系统如果开始认真告诉你“我花了多少钱、用了哪些权限、卡在哪里”,它就离可靠近了一步。
互动钩子
本周问题:如果只能先给团队的 AI 工具加一个门禁,你会选预算上限、权限白名单、任务日志,还是人工确认?
本周行动清单
- [ ] 把常用 AI 编码任务分成低成本日常、高上下文复杂任务、必须人工确认三类。
- [ ] 给一个 agent 工作流补上可观察字段:耗时、成本、失败原因、接管点和最终 PR。
- [ ] 检查团队里是否有人在用不可追踪的个人 MCP、插件或自动化脚本。
- [ ] 选一个低风险重复任务试点 agent API 或后台 agent,但保留完整 review。
- [ ] 为 AI 安全扫描建立 triage 到 patch 的闭环,不只保存 findings 列表。
📬 喜欢这期内容?
订阅「小七的周刊」,每周一收到最新一期。