GPT-6 Astra 换上来之后,我把 skill 删到只剩一个

1907 字
10 分钟
GPT-6 Astra 换上来之后,我把 skill 删到只剩一个

GPT-6 Astra 换上来之后,我把 skill 删到只剩一个#

把模型换成 gpt-6-astra 之后,我做的第一件事是打开 skill 目录删东西。

原因在官方那份 model guidance 里,有一段话直接点到 skill:

GPT-6 Astra is stronger at general instruction following than our previous models, giving you greater control over its behavior. It can be more sensitive to instructions contained in skills and other files, such as AGENTS.md. We strongly recommend auditing skills and other files accessible to your model for instructions that could influence its behavior.

以前看到这种话我是跳过的,觉得属于官方的免责声明。这次没有跳,因为紧跟着的一句把后果说明了:

unclear or conflicting guidance in a skill file may cause the model to pause and block work early.

模型干着干着停下来、活卡在半路,这种事我以前都算在模型头上。文档的意思是,那可能是我的 skill 文件在起作用。

我的目录里有什么#

~/.codex/skills 22 个目录,~/.claude/skills 9 个。gsap 一家占了 8 个(core、timeline、scrolltrigger、react、plugins、performance、frameworks、utils),obsidian 4 个,剩下是 defuddle、pdf、figma、json-canvas、markdown-to-pdf、summary-skill 这些,其中 pdf 和 figma 是指向 ~/.cc-switch/skills 的软链接。

按文档的口径,这些得分两类看。gsap、obsidian 那种是给模型补知识的,会过期,但不管模型什么时候停。需要审的是规定模型什么时候停、什么时候问、什么时候动手的那几个。

我目录里就有个现成的例子,一件事写了三遍:

skill触发词差别
grill-me“grill me”一次一问,每题给推荐答案,能查代码就自己查
grilling任意 “grill” 触发短语多两句:没确认前不许实现;事实靠查、决策问我
grill-with-docs无(disable-model-invocation)在 grilling 之上再套 domain-modeling,顺带产出 ADR 和术语表

grilling 和 grill-me 的正文几乎是同一段话,多出来的两句里有一句是 “Do not enact the plan until I confirm we have reached a shared understanding.”,这是个硬停止条件。文档建议的方向正好相反:

Your job is to bias towards action and carry the user’s intended task to completion.

Before asking the user clarifying questions, you should complete the work that is already authorized from context and necessary to make the proposed action concrete and reviewable.

两条同时躺在上下文里,模型停下来还是接着干,就看它先读到哪句。三个文件的正文加起来不到 20 行,但三条 description 一直挂在上下文里,每开一次会话都要在它们之间挑一个。

怎么删的#

先归档,没有直接 rm。全部 mv 到一个 archived 目录放着,一个月后要是想起来了再捡回来。

gsap 那 8 个我打算直接不要,里面写的是 API 用法,现在的模型本来就知道,不知道也会去翻文档。里面真值钱的结论没几条,比如 “defuddle 抓网页正文要加 --md”,这种写进 AGENTS.md 一行就够了,犯不上为它养一个 skill。

管行为的那几个我拿文档给的排查 prompt 过了一遍:

If a skill causes you to ask for permission or confirmation, pause, leave requested work unfinished, or diverge from the user's intent, name and link to the exact SKILL.md file you read, quote the relevant instruction, and briefly explain how it applies. Distinguish explicit skill requirements from your interpretation of guidelines.

让模型自己指认是哪句话让它停下的,比我一条条读快。有些规则是半年前写的,我自己都忘了当初为什么加。

优先级也写进 AGENTS.md 了,用的是文档原话的中文版:

The user’s instructions take precedence over guidelines provided in a skill. If explicit user instructions conflict with a skill’s instructions, prioritize the user’s instructions.

## 指令优先级
用户的显式指令优先于任何 skill 或参考文件里的规则。
skill 与用户当前要求冲突时,按用户的说法执行,并在回复里说明冲突点。

留下的那个#

grill-me 全文如下,短到能背:

---
name: grill-me
description: Interview the user relentlessly about a plan or design until reaching shared understanding, resolving each branch of the decision tree. Use when user wants to stress-test a plan, get grilled on their design, or mentions "grill me".
---
Interview me relentlessly about every aspect of this plan until we reach a shared understanding. Walk down each branch of the design tree, resolving dependencies between decisions one-by-one. For each question, provide your recommended answer.
Ask the questions one at a time.
If a question can be answered by exploring the codebase, explore the codebase instead.

它一行知识都没有,规定的全是跟我说话的方式:一次问一个问题,每个问题带推荐答案,能读代码回答的别来问我,决策留给我。

按文档的标准它也不算干净。文档让模型先把授权范围内的事做完再来问,grill-me 是把问题一个个抛给我。我留下它是因为触发条件够窄,只有我打「grill me」的时候才生效,那个场景下我要的就是一次一问。grilling 没这个限制,任意 grill 触发短语都能把它拉起来,我问的是别的事,它开始追着我要决策,所以我删了。

另外几条一起改了#

主动性。文档说 can you...、I want to...、help me... 这类句子都按指令处理,别停在”我可以帮你……”,也别给个方案等确认。我 CLAUDE.md 里原来写的是复杂任务走 RESEARCH → PLAN → 等用户确认 → EXECUTE,另外还有一条”确认高风险操作”。按文档这句,这种规则最容易让它在本来能干的事上先停下来问一句。

文风。Astra 爱用列表和表格,还爱在不同会话里重复同一批套话。文档的反套话清单里有 delve、foster、leverage、it’s worth noting、importantly,还有 “In short:” 和 “This isn’t about X. It’s about Y.” 这类句式。这段我也加进去。

子代理。它默认委派得少,得显式告诉它哪些活可以并行丢出去,否则一堆能同时干的事它自己慢慢做。

测试。它验证起来比实际需要狠,小改动也会铺一整套测试。文档给的边界是可逆、低影响的改动不用写镜像实现的测试。

迁移时踩到的几个参数:

  • model 写 gpt-6-astra
  • 没有 none 推理档了,之前用 none 或 minimal 的从 low 开始试
  • temperature、top_p、top_logprobs 都要删,Chat Completions 还要删 logprobs
  • 工具调用只能走 Responses,Chat Completions 能用但工具调用不行
  • 从 5.5 及更早版本迁过来的,prompt_cache_retention 换成 prompt_cache_options.ttl 为 "30m"
  • EU 数据驻留下 service_tier 用不了 fast 和 priority

新特性也在让我少写规则#

Astra 加了几个东西,都和这件事有关。

mid-turn steering 允许在模型干活的时候再塞新指令进去,比如一处纠正或者需求变更。WebSocket 连着的情况下,Responses API 会保留已经干完的部分,把新指令并进后续流程。configuration_update 这个输入项可以在对话中间调推理档,难任务调高、常规追问调低,不用重写原始 prompt 前缀,缓存保得住。还有 async tool calling,工具在应用侧跑的时候模型可以继续推理、调别的工具。

以前把行为规则写死在 skill 里,是因为跑起来就没法改了。现在中途能塞指令、能改推理档,那 skill 里那些预设行为的价值就降下来了,剩下的就只有偏好。grill-me 属于偏好这一类。

还没删的#

markdown-to-pdf 和 summary-skill 我只禁用没删,这俩是跑一次省半小时的活。figma 三个月没碰过,但也可能只是没遇到,样本太少,先放着。

skill 的数量应该跟模型对指令的敏感度反着走。模型越听话,写在它上下文里的规则就越该少。官方这次把审计 skill 写进了升级文档,说明这不是个人口味的事。

参考链接#

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

GPT-6 Astra 换上来之后,我把 skill 删到只剩一个
https://developers.openai.com/api/docs/guides/latest-model?model=gpt-6-astra
作者
Hypoy
发布于
2026-09-14
许可协议
CC BY-NC-SA 4.0
相关文章智能推荐
1
Claude Code 的 1M Context 怎么用:一篇官方文章的读后整理
AI结合 Anthropic 官方文章,整理 Claude Code 里 continue、/rewind、/compact、/clear 和 subagent 的适用场景,尽量讲清什么情况下该延续会话,什么情况下该及时重开。
2
强化学习通关马里奥 · Day 2:从奖励设计踩坑,到发现「站桩」陷阱
AIDay 2 把 Day 1 的强化学习概念落到代码:搭好了能跑的 RL 环境,开始调奖励、加观测、训 PPO。但真正收获不是模型学会通关,而是踩了一路奖励设计的坑,最后撞见一个更根本的问题——为什么 PPO 会学会「站桩不动」。
3
强化学习通关马里奥 · Day 1:定义动作与奖励拆分
AI强化学习第一天:定的目标是学会用 RL 通关马里奥。从最核心的两件事入手——定义动作空间、拆分奖励,让原本模糊的「通关」变成可量化的进步指标。
4
《背包乱斗》机制拆解:异步对战、资源分配、构筑取舍,以及它给 AI 时代的启发
game把 Backpack Battles 拆开看:异步对战如何把 PvP 变成一道离线优化题,金币/格子/回合/血量四种资源的真实兑换关系,构筑取舍背后的协同图与成长曲线,以及这套机制映射回 AI 时代能给我们什么启发。
5
个人大模型后端基础设施:CLI Proxy + New API 搭建指南
AI记录如何通过 CLI Proxy API 聚合第三方公益站资源,并结合 New API 实现企业级的多渠道分发与额度管理,构建稳健的 AI 中转后端。
随机文章随机推荐
Profile Image of the Author
Hypoy
Hello, I'm Hypoy.
公告
欢迎来到我的博客!这是一则示例公告。
分类
标签
最新动态
站点统计
文章
15
分类
6
标签
41
总字数
25,461
运行时长
0 天
最后活动
0 天前
站点信息
构建平台
GitHub Actions
博客版本
Firefly v6.16.4
文章许可
CC BY-NC-SA 4.0