@alex_notes · 4 小时前
把我的小型评测工具开源了:20 条复杂输入、预期输出,一条命令就能检查改提示词到底有没有用。朴素的工具往往最管用。
陪你刷 X 的 Chrome 扩展
收起不想看的帖子和评论,留下你关心的讨论。
再帮你找一些,值得往下读的内容。


“多看真实的 AI 项目,少看政治话题。”

示例演示
不需要一次把自己解释清楚。
告诉它你的想法,用着用着,再调整。
“少看广告,技术讨论留下。” 从一个具体想法开始。
围绕你的兴趣和最近关注的事情,为你寻找值得看的内容。
看看它记住了什么。可以纠正误判、临时展开,也可以撤销变化。
刷了很久,不代表看得开心。你想少看什么、想了解什么,比停留了多久更重要。

好的讨论,
别被噪音打断。
周末做了个小改动:让 Agent 跑完测试,才能说“完成了”。 比我改过的任何提示词都管用。
测试是整个循环的一部分,还是结束之后单独跑的?
在循环里面。测试失败后,Agent 会拿到报错信息,必须再试一次。
同感。把失败用例存成回归测试,比换模型更管用。