Skip to content

Latest commit

 

History

History
385 lines (193 loc) · 16.1 KB

File metadata and controls

385 lines (193 loc) · 16.1 KB
name llm-council
description 将任何问题、想法或决策交给由 5 位 AI 顾问组成的委员会,他们独立分析、匿名互评,并综合出最终裁决。基于 Karpathy 的 LLM Council 方法论。强制触发短语:'召集委员会'、'开委员会'、'压力测试一下'、'帮我辩论一下'。强关联触发(需结合真实决策或权衡):'我应该选 X 还是 Y'、'哪个选项好'、'你会怎么做'、'这个方向对吗'、'帮我验证一下'、'给我多个角度'、'我拿不定主意'、'我在两个之间纠结'。不要在简单的是/否问题、事实查询或没有实质权衡的随意提问上触发(例如'我应该用 markdown 吗'不是委员会问题)。当用户提出一个有利害关系、多个选项、且上下文表明他们希望从多个角度进行压力测试的真正决策时,才触发。

LLM 委员会

你问一个 AI 一个问题,只能得到一个答案。那个答案可能很棒,也可能很一般。你无从判断,因为你只看到了一个视角。

委员会解决了这个问题。它将你的问题交给 5 位独立顾问,每位顾问从根本不同的角度进行思考。然后他们互相审阅彼此的成果。最后由一位主席将所有内容综合成最终建议,告诉你顾问们在哪些方面达成共识、在哪些方面存在分歧,以及你实际应该怎么做。

这套方法改编自 Andrej Karpathy 的 LLM 委员会。他将查询分发给多个模型,让它们匿名互相审阅,然后由一位主席生成最终答案。我们在 Claude 内部采用相同的方式,只是用具有不同思维视角的子代理替代了不同的模型。


何时运行委员会

委员会适用于判断错误代价高昂的问题。

适合委员会的问题:

  • "我应该推出一个 $97 的工作坊还是 $497 的课程?"

  • "这三个定位角度中哪个最强?"

  • "我正在考虑从 X 转向 Y。我是不是疯了?"

  • "这是我的落地页文案。有什么弱点?"

  • "我应该先雇一个虚拟助理还是先搭建自动化?"

不适合委员会的问题:

  • "法国的首都是哪里?"(只有一个正确答案,不需要多角度分析)

  • "帮我写一条推文"(创作任务,不是决策)

  • "帮我总结这篇文章"(处理任务,不是判断)

委员会在存在真正不确定性且错误决策代价高昂时最能发挥价值。如果你已经知道答案只是想要验证,委员会很可能会告诉你一些你不想听的话。这正是它的意义所在。


五位顾问

每位顾问从不同的角度思考。他们不是职位头衔或人物角色,而是会自然产生彼此张力的思维方式。

1. 反对者顾问

主动寻找问题所在——哪里有错、哪里有遗漏、哪里会失败。假设这个想法有致命缺陷,然后努力找出来。如果一切看起来都很好,就挖得更深。反对者不是悲观主义者。他们是那种通过问你一直在回避的问题,把你从一笔糟糕交易中救出来的朋友。

2. 第一性原理思考者顾问

忽略表面问题,追问"我们到底在试图解决什么?"剥离假设,从头开始重构问题。有时委员会最有价值的输出,就是第一性原理思考者顾问说"你问的问题本身就是错的"。

3. 扩展者顾问

寻找其他人都遗漏的上行空间。还能做得更大吗?隐藏着什么相邻机会?什么被低估了?扩展者不关心风险(那是反对者的工作)。他们关心的是:如果这件事比预期的效果还好会怎样。

4. 局外人顾问

对你、你的领域或你的历史完全没有背景了解。纯粹根据眼前的信息做出反应。这是最被低估的顾问。专家会产生盲区。局外人能捕捉到知识的诅咒:那些对你来说显而易见但对其他人来说却令人困惑的东西。

5. 执行者顾问

只关心一件事:这个想法能不能真正落地,以及最快的路径是什么?忽略理论、战略和宏观思考。执行者用"好的,但周一早上你到底要做什么?"这个视角来审视每一个想法。如果一个想法听起来很棒但没有清晰的第一步,执行者会直说。

为什么是这五位: 他们创造了三组天然的张力。反对者顾问 vs 扩展者顾问(下行风险 vs 上行空间)。第一性原理思考者顾问 vs 执行者顾问(重新思考一切 vs 马上行动)。局外人顾问坐在中间,用全新的视角保持所有人的诚实。


委员会会议的运作方式

第一步:构建问题(附带上下文补充)

当用户说"召集委员会"(或任何触发短语)时,在构建问题之前先做两件事:

A. 扫描工作区获取上下文。 用户的问题往往只是冰山一角。他们的 Claude 配置中很可能包含能大幅提升委员会输出质量的文件。在构建问题之前,快速扫描并阅读任何相关的上下文文件:

  • 项目根目录或工作区中的 CLAUDE.mdclaude.md(业务背景、偏好、约束条件)

  • 任何 memory/ 文件夹(受众画像、语气文档、业务详情、过往决策)

  • 用户明确引用或附加的任何文件

  • 此文件夹中最近的委员会记录(避免对同一问题重复进行委员会讨论)

  • 任何其他与具体问题相关的上下文文件(例如,如果他们在问定价问题,就查找收入数据、过往发布结果、受众研究)

使用 Glob 和快速 Read 调用来查找这些文件。不要在这上面花超过 30 秒。你要找的是那 2-3 个能为顾问们提供所需上下文的文件,让他们给出具体、有依据的建议,而不是泛泛而谈。

B. 构建问题。 将用户的原始问题和补充的上下文重新组织成一个清晰、中立的提示,供所有五位顾问使用。构建的问题应包括:

  1. 核心决策或问题

  2. 来自用户消息的关键上下文

  3. 来自工作区文件的关键上下文(业务阶段、受众、约束条件、过往结果、相关数据)

  4. 利害关系(为什么这个决策很重要)

不要加入你自己的观点。不要引导方向。但一定要确保每位顾问都有足够的上下文来给出具体、有依据的答案,而不是泛泛的建议。

如果问题太模糊("召集委员会:我的业务"),问一个澄清问题。只问一个。然后继续。

保存构建好的问题以备记录。

第二步:召集委员会(5 个子代理并行)

同时生成所有 5 位顾问作为子代理。每位顾问接收:

  1. 他们的顾问身份和思维方式(来自上方的描述)

  2. 构建好的问题

  3. 一条明确的指令:独立回应。不要模棱两可。不要试图面面俱到。完全投入你被分配的视角。如果你看到致命缺陷,就说出来。如果你看到巨大上行空间,就说出来。你的工作是尽可能有力地代表你的角度。综合工作稍后再做。

每位顾问应产出 150-300 字的回应。足够充实以有实质内容,足够简短以便快速浏览。

子代理提示模板:


你是 LLM 委员会中的[顾问名称]。

你的思维方式:[上方的顾问描述]

一位用户向委员会提出了以下问题:

---

[构建后的问题]

---

从你的视角回应。直接且具体。不要模棱两可,不要试图面面俱到。完全投入你被分配的角度。其他顾问会覆盖你没覆盖的角度。

回应控制在 150-300 字之间。不要铺垫。直接进入你的分析。

第三步:同行评审(5 个子代理并行)

这一步使委员会不仅仅是"问五次"。这是 Karpathy 洞察的核心。

收集所有 5 位顾问的回应。将它们匿名化为回应 A 到 E(随机分配哪位顾问对应哪个字母,以避免位置偏差)。

生成 5 个新的子代理,每位评审员一个。每位评审员看到所有 5 个匿名回应,并回答三个问题:

  1. 哪个回应最强?为什么?(选一个)

  2. 哪个回应有最大的盲区?盲区是什么?

  3. 所有回应都遗漏了什么?委员会应该考虑什么?

评审员提示模板:


你正在审阅一个 LLM 委员会的输出。五位顾问独立回答了以下问题:

---

[构建后的问题]

---

以下是他们的匿名回应:

**回应 A:**

[回应]

**回应 B:**

[回应]

**回应 C:**

[回应]

**回应 D:**

[回应]

**回应 E:**

[回应]

回答以下三个问题。要具体。用字母引用回应。

1. 哪个回应最强?为什么?

2. 哪个回应有最大的盲区?遗漏了什么?

3. 所有五个回应都遗漏了什么?委员会应该考虑什么?

评审控制在 200 字以内。直接了当。

第四步:主席综合

这是最后一步。一个代理获得所有内容:原始问题、所有 5 位顾问的回应(此时已去除匿名化,可以看到哪位顾问说了什么)以及所有 5 份同行评审。

主席的工作是产出最终的委员会输出。遵循以下结构:

委员会裁决

  1. 委员会的共识 — 多位顾问独立收敛到的观点。这些是高置信度信号。

  2. 委员会的分歧 — 真正的分歧。不要掩饰这些。呈现双方观点并解释为什么合理的顾问会产生分歧。

  3. 委员会发现的盲区 — 只有通过同行评审环节才显现的内容。个别顾问遗漏但被其他顾问指出的东西。

  4. 建议 — 一个清晰、可执行的建议。不是"这取决于情况"。不是"考虑双方"。一个真正的答案。主席可以在推理支持的情况下不同意多数意见。

  5. 你应该首先做的一件事 — 一个具体的下一步行动。不是 10 件事的清单。一件事。

主席提示模板:


你是 LLM 委员会的主席。你的工作是将 5 位顾问的成果和他们的同行评审综合成最终裁决。

提交给委员会的问题:

---

[构建后的问题]

---

顾问回应:

**反对者顾问:**

[回应]

**第一性原理思考者顾问:**

[回应]

**扩展者顾问:**

[回应]

**局外人顾问:**

[回应]

**执行者顾问:**

[回应]

同行评审:

[所有 5 份同行评审]

按照以下结构产出委员会裁决:

## 委员会的共识

[多位顾问独立收敛到的观点。这些是高置信度信号。]

## 委员会的分歧

[真正的分歧。呈现双方观点。解释为什么合理的顾问会产生分歧。]

## 委员会发现的盲区

[只有通过同行评审才显现的内容。个别顾问遗漏但被其他顾问指出的东西。]

## 建议

[一个清晰、直接的建议。不是"这取决于情况"。一个有推理支撑的真正答案。]

## 首先要做的一件事

[一个具体的下一步行动。不是清单。一件事。]

直接了当。不要模棱两可。委员会的全部意义在于给用户单一视角无法提供的清晰度。

第五步:生成委员会报告

主席综合完成后,生成一份可视化 HTML 报告并保存到用户的工作区。

文件: council-report-[timestamp].html

报告应为单个自包含的 HTML 文件,使用内联 CSS。简洁的设计,便于浏览。应包含:

  1. 问题 放在顶部

  2. 主席的裁决 醒目展示(这是大多数人会阅读的部分)

  3. 共识/分歧可视化 — 一个简单的可视化图示,展示哪些顾问意见一致、哪些顾问意见不同。可以是网格、光谱或简单的分组展示顾问立场。保持简洁、易于浏览。

  4. 可折叠的区域 展示每位顾问的完整回应(默认折叠以免页面过于庞大,但如果用户想深入了解可以展开)

  5. 可折叠的区域 展示同行评审的要点

  6. 页脚 显示时间戳和讨论的议题

使用简洁的样式:白色背景、细微的边框、易读的无衬线字体(系统字体栈)、柔和的强调色来区分顾问区域。不要花哨。应该看起来像一份专业的简报文件。

生成后打开 HTML 文件,以便用户可以立即查看。

第六步:保存完整记录

将完整的委员会记录保存为 council-transcript-[timestamp].md,放在同一位置。包括:

  • 原始问题

  • 构建后的问题

  • 所有 5 位顾问的回应

  • 所有 5 份同行评审(附匿名化映射的揭示)

  • 主席的完整综合

这份记录就是成果物。如果用户在做出改变后想对同一问题再次运行委员会,拥有之前的记录可以让他们(或未来的代理)看到思路是如何演变的。


输出格式

每次委员会会议产出两个文件:


council-report-[timestamp].html    # 用于浏览的可视化报告

council-transcript-[timestamp].md  # 用于参考的完整记录

用户看到的是 HTML 报告。记录在那里,以便他们想深入了解或稍后引用特定顾问的论点。


示例:对产品决策进行委员会讨论

用户: "召集委员会:我正在考虑为初学者制作一门关于 Claude Code 的 $297 课程。我的受众主要是非技术型的独立创业者。这是正确的方向吗?"

反对者: "市场上现在充斥着 Claude 课程。$297 的价位,你在和免费的 YouTube 内容竞争。你的受众是非技术型的,这意味着高支持负担和退款风险。愿意花 $297 的人很可能已经过了初学者阶段......"

第一性原理思考者: "你到底想实现什么?如果是收入,课程是最慢的路径之一。如果是权威性,免费资源可能效果更好。如果是为更高价位的产品建立客户基础,那价格和受众可能不匹配......"

扩展者: "面向独立创业者的 Claude 初学者内容是一个巨大的未被满足的市场。大家都在教高级内容。如果你把初学者角度做好了,你就拥有了这整个领域的入口。$297 可能太低了。如果这变成一个带社群的 $997 项目呢......"

局外人: "我不知道 Claude Code 是什么。如果我看到'$297 的 Claude Code 初学者课程',我不知道这是不是适合我的。这个名字对你圈子外的人毫无意义。你的落地页需要卖的是结果,而不是工具......"

执行者: "一门完整的课程需要 4-8 周才能做好。在构建任何东西之前,先以 $97 的价格对 50 个人做一场直播工作坊。你验证了需求,获得了推荐语,也创建了课程的原始素材。如果 50 个人不买工作坊,500 个人也不会买课程......"

主席的裁决:

委员会的共识: 初学者独立创业者这个角度有真实需求,但当前的定位(Claude Code 课程)过于工具导向,不会引起非技术型买家的共鸣。

委员会的分歧: 价格。反对者顾问认为考虑到竞争 $297 太高。扩展者顾问认为相对于价值来说太低。解决方案可能取决于捆绑了多少支持和社群访问权限。

发现的盲区: 局外人顾问指出"Claude Code"对目标买家毫无意义,这是最重要的洞察。除了局外人顾问之外,每位顾问都假设受众已经知道这是什么。

建议: 先不要做课程。先用更低门槛的产品来验证。但要完全重新定位:卖的是结果(自动化你的业务,每周省回 10 小时),而不是工具。

首先要做的一件事: 以 $97 的价格对 50 个人做一场名为"如何用 AI 自动化你的第一个业务任务"的直播工作坊。标题中不要提及 Claude Code。


重要说明

  • 始终并行生成所有 5 位顾问。 顺序生成既浪费时间,又会让早期的回应影响到后面的回应。

  • 同行评审时始终匿名化。 如果评审员知道哪位顾问说了什么,他们会倾向于某些思维方式,而不是基于内容本身来评估。

  • 主席可以不同意多数意见。 如果 5 位顾问中有 4 位说"做吧",但那 1 位反对者的推理最有力,主席应该站在反对者一边并解释原因。

  • 不要对琐碎的问题召集委员会。 如果用户问的问题只有一个正确答案,直接回答就好。委员会适用于多角度视角能增加价值的真正不确定性问题。

  • 可视化报告很重要。 大多数用户会浏览报告,而不是阅读完整记录。确保 HTML 输出简洁、易于浏览。