| name | llm-council |
|---|---|
| description | 将任何问题、想法或决策交给由 5 位 AI 顾问组成的委员会,他们独立分析、匿名互评,并综合出最终裁决。基于 Karpathy 的 LLM Council 方法论。强制触发短语:'召集委员会'、'开委员会'、'压力测试一下'、'帮我辩论一下'。强关联触发(需结合真实决策或权衡):'我应该选 X 还是 Y'、'哪个选项好'、'你会怎么做'、'这个方向对吗'、'帮我验证一下'、'给我多个角度'、'我拿不定主意'、'我在两个之间纠结'。不要在简单的是/否问题、事实查询或没有实质权衡的随意提问上触发(例如'我应该用 markdown 吗'不是委员会问题)。当用户提出一个有利害关系、多个选项、且上下文表明他们希望从多个角度进行压力测试的真正决策时,才触发。 |
你问一个 AI 一个问题,只能得到一个答案。那个答案可能很棒,也可能很一般。你无从判断,因为你只看到了一个视角。
委员会解决了这个问题。它将你的问题交给 5 位独立顾问,每位顾问从根本不同的角度进行思考。然后他们互相审阅彼此的成果。最后由一位主席将所有内容综合成最终建议,告诉你顾问们在哪些方面达成共识、在哪些方面存在分歧,以及你实际应该怎么做。
这套方法改编自 Andrej Karpathy 的 LLM 委员会。他将查询分发给多个模型,让它们匿名互相审阅,然后由一位主席生成最终答案。我们在 Claude 内部采用相同的方式,只是用具有不同思维视角的子代理替代了不同的模型。
委员会适用于判断错误代价高昂的问题。
适合委员会的问题:
-
"我应该推出一个 $97 的工作坊还是 $497 的课程?"
-
"这三个定位角度中哪个最强?"
-
"我正在考虑从 X 转向 Y。我是不是疯了?"
-
"这是我的落地页文案。有什么弱点?"
-
"我应该先雇一个虚拟助理还是先搭建自动化?"
不适合委员会的问题:
-
"法国的首都是哪里?"(只有一个正确答案,不需要多角度分析)
-
"帮我写一条推文"(创作任务,不是决策)
-
"帮我总结这篇文章"(处理任务,不是判断)
委员会在存在真正不确定性且错误决策代价高昂时最能发挥价值。如果你已经知道答案只是想要验证,委员会很可能会告诉你一些你不想听的话。这正是它的意义所在。
每位顾问从不同的角度思考。他们不是职位头衔或人物角色,而是会自然产生彼此张力的思维方式。
主动寻找问题所在——哪里有错、哪里有遗漏、哪里会失败。假设这个想法有致命缺陷,然后努力找出来。如果一切看起来都很好,就挖得更深。反对者不是悲观主义者。他们是那种通过问你一直在回避的问题,把你从一笔糟糕交易中救出来的朋友。
忽略表面问题,追问"我们到底在试图解决什么?"剥离假设,从头开始重构问题。有时委员会最有价值的输出,就是第一性原理思考者顾问说"你问的问题本身就是错的"。
寻找其他人都遗漏的上行空间。还能做得更大吗?隐藏着什么相邻机会?什么被低估了?扩展者不关心风险(那是反对者的工作)。他们关心的是:如果这件事比预期的效果还好会怎样。
对你、你的领域或你的历史完全没有背景了解。纯粹根据眼前的信息做出反应。这是最被低估的顾问。专家会产生盲区。局外人能捕捉到知识的诅咒:那些对你来说显而易见但对其他人来说却令人困惑的东西。
只关心一件事:这个想法能不能真正落地,以及最快的路径是什么?忽略理论、战略和宏观思考。执行者用"好的,但周一早上你到底要做什么?"这个视角来审视每一个想法。如果一个想法听起来很棒但没有清晰的第一步,执行者会直说。
为什么是这五位: 他们创造了三组天然的张力。反对者顾问 vs 扩展者顾问(下行风险 vs 上行空间)。第一性原理思考者顾问 vs 执行者顾问(重新思考一切 vs 马上行动)。局外人顾问坐在中间,用全新的视角保持所有人的诚实。
当用户说"召集委员会"(或任何触发短语)时,在构建问题之前先做两件事:
A. 扫描工作区获取上下文。 用户的问题往往只是冰山一角。他们的 Claude 配置中很可能包含能大幅提升委员会输出质量的文件。在构建问题之前,快速扫描并阅读任何相关的上下文文件:
-
项目根目录或工作区中的
CLAUDE.md或claude.md(业务背景、偏好、约束条件) -
任何
memory/文件夹(受众画像、语气文档、业务详情、过往决策) -
用户明确引用或附加的任何文件
-
此文件夹中最近的委员会记录(避免对同一问题重复进行委员会讨论)
-
任何其他与具体问题相关的上下文文件(例如,如果他们在问定价问题,就查找收入数据、过往发布结果、受众研究)
使用 Glob 和快速 Read 调用来查找这些文件。不要在这上面花超过 30 秒。你要找的是那 2-3 个能为顾问们提供所需上下文的文件,让他们给出具体、有依据的建议,而不是泛泛而谈。
B. 构建问题。 将用户的原始问题和补充的上下文重新组织成一个清晰、中立的提示,供所有五位顾问使用。构建的问题应包括:
-
核心决策或问题
-
来自用户消息的关键上下文
-
来自工作区文件的关键上下文(业务阶段、受众、约束条件、过往结果、相关数据)
-
利害关系(为什么这个决策很重要)
不要加入你自己的观点。不要引导方向。但一定要确保每位顾问都有足够的上下文来给出具体、有依据的答案,而不是泛泛的建议。
如果问题太模糊("召集委员会:我的业务"),问一个澄清问题。只问一个。然后继续。
保存构建好的问题以备记录。
同时生成所有 5 位顾问作为子代理。每位顾问接收:
-
他们的顾问身份和思维方式(来自上方的描述)
-
构建好的问题
-
一条明确的指令:独立回应。不要模棱两可。不要试图面面俱到。完全投入你被分配的视角。如果你看到致命缺陷,就说出来。如果你看到巨大上行空间,就说出来。你的工作是尽可能有力地代表你的角度。综合工作稍后再做。
每位顾问应产出 150-300 字的回应。足够充实以有实质内容,足够简短以便快速浏览。
子代理提示模板:
你是 LLM 委员会中的[顾问名称]。
你的思维方式:[上方的顾问描述]
一位用户向委员会提出了以下问题:
---
[构建后的问题]
---
从你的视角回应。直接且具体。不要模棱两可,不要试图面面俱到。完全投入你被分配的角度。其他顾问会覆盖你没覆盖的角度。
回应控制在 150-300 字之间。不要铺垫。直接进入你的分析。
这一步使委员会不仅仅是"问五次"。这是 Karpathy 洞察的核心。
收集所有 5 位顾问的回应。将它们匿名化为回应 A 到 E(随机分配哪位顾问对应哪个字母,以避免位置偏差)。
生成 5 个新的子代理,每位评审员一个。每位评审员看到所有 5 个匿名回应,并回答三个问题:
-
哪个回应最强?为什么?(选一个)
-
哪个回应有最大的盲区?盲区是什么?
-
所有回应都遗漏了什么?委员会应该考虑什么?
评审员提示模板:
你正在审阅一个 LLM 委员会的输出。五位顾问独立回答了以下问题:
---
[构建后的问题]
---
以下是他们的匿名回应:
**回应 A:**
[回应]
**回应 B:**
[回应]
**回应 C:**
[回应]
**回应 D:**
[回应]
**回应 E:**
[回应]
回答以下三个问题。要具体。用字母引用回应。
1. 哪个回应最强?为什么?
2. 哪个回应有最大的盲区?遗漏了什么?
3. 所有五个回应都遗漏了什么?委员会应该考虑什么?
评审控制在 200 字以内。直接了当。
这是最后一步。一个代理获得所有内容:原始问题、所有 5 位顾问的回应(此时已去除匿名化,可以看到哪位顾问说了什么)以及所有 5 份同行评审。
主席的工作是产出最终的委员会输出。遵循以下结构:
委员会裁决
-
委员会的共识 — 多位顾问独立收敛到的观点。这些是高置信度信号。
-
委员会的分歧 — 真正的分歧。不要掩饰这些。呈现双方观点并解释为什么合理的顾问会产生分歧。
-
委员会发现的盲区 — 只有通过同行评审环节才显现的内容。个别顾问遗漏但被其他顾问指出的东西。
-
建议 — 一个清晰、可执行的建议。不是"这取决于情况"。不是"考虑双方"。一个真正的答案。主席可以在推理支持的情况下不同意多数意见。
-
你应该首先做的一件事 — 一个具体的下一步行动。不是 10 件事的清单。一件事。
主席提示模板:
你是 LLM 委员会的主席。你的工作是将 5 位顾问的成果和他们的同行评审综合成最终裁决。
提交给委员会的问题:
---
[构建后的问题]
---
顾问回应:
**反对者顾问:**
[回应]
**第一性原理思考者顾问:**
[回应]
**扩展者顾问:**
[回应]
**局外人顾问:**
[回应]
**执行者顾问:**
[回应]
同行评审:
[所有 5 份同行评审]
按照以下结构产出委员会裁决:
## 委员会的共识
[多位顾问独立收敛到的观点。这些是高置信度信号。]
## 委员会的分歧
[真正的分歧。呈现双方观点。解释为什么合理的顾问会产生分歧。]
## 委员会发现的盲区
[只有通过同行评审才显现的内容。个别顾问遗漏但被其他顾问指出的东西。]
## 建议
[一个清晰、直接的建议。不是"这取决于情况"。一个有推理支撑的真正答案。]
## 首先要做的一件事
[一个具体的下一步行动。不是清单。一件事。]
直接了当。不要模棱两可。委员会的全部意义在于给用户单一视角无法提供的清晰度。
主席综合完成后,生成一份可视化 HTML 报告并保存到用户的工作区。
文件: council-report-[timestamp].html
报告应为单个自包含的 HTML 文件,使用内联 CSS。简洁的设计,便于浏览。应包含:
-
问题 放在顶部
-
主席的裁决 醒目展示(这是大多数人会阅读的部分)
-
共识/分歧可视化 — 一个简单的可视化图示,展示哪些顾问意见一致、哪些顾问意见不同。可以是网格、光谱或简单的分组展示顾问立场。保持简洁、易于浏览。
-
可折叠的区域 展示每位顾问的完整回应(默认折叠以免页面过于庞大,但如果用户想深入了解可以展开)
-
可折叠的区域 展示同行评审的要点
-
页脚 显示时间戳和讨论的议题
使用简洁的样式:白色背景、细微的边框、易读的无衬线字体(系统字体栈)、柔和的强调色来区分顾问区域。不要花哨。应该看起来像一份专业的简报文件。
生成后打开 HTML 文件,以便用户可以立即查看。
将完整的委员会记录保存为 council-transcript-[timestamp].md,放在同一位置。包括:
-
原始问题
-
构建后的问题
-
所有 5 位顾问的回应
-
所有 5 份同行评审(附匿名化映射的揭示)
-
主席的完整综合
这份记录就是成果物。如果用户在做出改变后想对同一问题再次运行委员会,拥有之前的记录可以让他们(或未来的代理)看到思路是如何演变的。
每次委员会会议产出两个文件:
council-report-[timestamp].html # 用于浏览的可视化报告
council-transcript-[timestamp].md # 用于参考的完整记录
用户看到的是 HTML 报告。记录在那里,以便他们想深入了解或稍后引用特定顾问的论点。
用户: "召集委员会:我正在考虑为初学者制作一门关于 Claude Code 的 $297 课程。我的受众主要是非技术型的独立创业者。这是正确的方向吗?"
反对者: "市场上现在充斥着 Claude 课程。$297 的价位,你在和免费的 YouTube 内容竞争。你的受众是非技术型的,这意味着高支持负担和退款风险。愿意花 $297 的人很可能已经过了初学者阶段......"
第一性原理思考者: "你到底想实现什么?如果是收入,课程是最慢的路径之一。如果是权威性,免费资源可能效果更好。如果是为更高价位的产品建立客户基础,那价格和受众可能不匹配......"
扩展者: "面向独立创业者的 Claude 初学者内容是一个巨大的未被满足的市场。大家都在教高级内容。如果你把初学者角度做好了,你就拥有了这整个领域的入口。$297 可能太低了。如果这变成一个带社群的 $997 项目呢......"
局外人: "我不知道 Claude Code 是什么。如果我看到'$297 的 Claude Code 初学者课程',我不知道这是不是适合我的。这个名字对你圈子外的人毫无意义。你的落地页需要卖的是结果,而不是工具......"
执行者: "一门完整的课程需要 4-8 周才能做好。在构建任何东西之前,先以 $97 的价格对 50 个人做一场直播工作坊。你验证了需求,获得了推荐语,也创建了课程的原始素材。如果 50 个人不买工作坊,500 个人也不会买课程......"
主席的裁决:
委员会的共识: 初学者独立创业者这个角度有真实需求,但当前的定位(Claude Code 课程)过于工具导向,不会引起非技术型买家的共鸣。
委员会的分歧: 价格。反对者顾问认为考虑到竞争 $297 太高。扩展者顾问认为相对于价值来说太低。解决方案可能取决于捆绑了多少支持和社群访问权限。
发现的盲区: 局外人顾问指出"Claude Code"对目标买家毫无意义,这是最重要的洞察。除了局外人顾问之外,每位顾问都假设受众已经知道这是什么。
建议: 先不要做课程。先用更低门槛的产品来验证。但要完全重新定位:卖的是结果(自动化你的业务,每周省回 10 小时),而不是工具。
首先要做的一件事: 以 $97 的价格对 50 个人做一场名为"如何用 AI 自动化你的第一个业务任务"的直播工作坊。标题中不要提及 Claude Code。
-
始终并行生成所有 5 位顾问。 顺序生成既浪费时间,又会让早期的回应影响到后面的回应。
-
同行评审时始终匿名化。 如果评审员知道哪位顾问说了什么,他们会倾向于某些思维方式,而不是基于内容本身来评估。
-
主席可以不同意多数意见。 如果 5 位顾问中有 4 位说"做吧",但那 1 位反对者的推理最有力,主席应该站在反对者一边并解释原因。
-
不要对琐碎的问题召集委员会。 如果用户问的问题只有一个正确答案,直接回答就好。委员会适用于多角度视角能增加价值的真正不确定性问题。
-
可视化报告很重要。 大多数用户会浏览报告,而不是阅读完整记录。确保 HTML 输出简洁、易于浏览。