定义:约束优化研究将开放式探究从「找到答案」重构为「在约束条件下构建决策系统」。研究产出不是一个裁决——而是一组结构化的条件判断,每一条都被限定在证据强度、风险承受能力和用户特定约束条件之下。这种方法将鲁棒优化、敏感性分析、贝叶斯更新和决策分析中的方法进行了形式化,让研究结果不再是「听起来正确」,而是「在给定条件下可辩护」。
答案生成的问题
「英伟达值得买吗?」听起来像一个有答案的问题。其实不是。它是一个包含隐藏变量的决策问题:谁在买,持有多久,投入多少资金,能承受多大回撤,和哪些替代方案比,什么信息会改变判断。没有这些约束,「值得」这个词就没有稳定的含义——对一个退休的保守投资者和一个年轻的高收入工程师来说,「值得」意味着完全不同的东西。
答案生成优化的是可信度:产出一个听起来全面、平衡、权威的回答。这类回答往往面面俱到但不可操作——它告诉你「有优点也有风险,取决于你的具体情况」,然后把决策的重担原封不动地还给你。约束优化优化的是决策效用:产出一个帮助用户根据自身实际处境做出更好决策的系统。它不只是分析对象本身,还要分析你和这个对象之间的关系。
形式化框架
决策被形式化为一个优化问题:
max_a U(a | E, H, C) − λR(a) − γI(a)
其中 a 是候选动作(比如「买入」「持有」「卖出」「继续研究」),U 是在证据 E、假设 H 和约束 C 下的预期效用,R是风险项(衡量最坏情况的代价),I是不确定性成本(衡量当前证据不足带来的风险),λ 和 γ 是用户的惩罚权重。这些权重不是物理常数——它们是编码用户真实情况的归一化偏好系数。
实用默认值:低风险的可逆任务(比如「试试这个新工具」)取 λ ≈ 1,γ ≈ 1——风险和不确定性都不是大问题,快速行动就好。高回撤动作(比如「全仓买入某只股票」)大幅提高 λ——你承受不起最坏情况。缺失可能改变建议的关键证据时提高 γ——在信息不足的情况下行动比等待更危险。如果用户没有明确指定约束条件,报告会在不同权重分支下给出条件判断,让用户自己选择最符合自身情况的分支。
十二步方法
这十二步分为两组:前八步确保分析质量,后四步确保决策质量。在得出结论之前,每一步都必须执行:
- 重建目标函数。用户到底在优化什么?很多研究失败不是因为分析有误,而是从一开始就优化了错误的目标。
- 拆分事实、假设、推理和价值判断。这四类信息的可信度完全不同,混在一起讨论会导致判断混乱。
- 区分对象质量和行动吸引力。一个好公司不一定是一笔好投资(如果价格太高);一个好产品不一定值得采用(如果迁移成本太大)。
- 多起点搜索。从对立的出发点开始分析。如果你的初始假设是「应该买」,先认真论证「不应该买」的理由。
- 反事实扰动。改变一个关键假设,看结论是否翻转。如果结论对某个假设高度敏感,那个假设就是需要更多证据的地方。
- 敏感性分析。哪些输入会翻转建议?找出结论的「断裂点」——在什么条件下结论会从「是」变成「否」。
- 逆向工程隐含期望。如果当前建议成立,市场或现实必须满足哪些隐含条件?这些条件是否真的成立?
- 对抗性验证。站在对立面,用最强的论据反驳你的结论。如果反驳站不住脚,结论更可信;如果反驳有力,你需要修正结论。
- 贝叶斯更新。展示后验分布如何随证据变化。新证据到来时,你的信念应该往哪个方向移动多少?
- 情景分析与决策树。把不同情景下的结果画出来,明确每个分支的概率和收益。
- 加入个人约束。通用分析不考虑你的资金规模、流动性需求、税务情况和心理承受能力。把这些加进去。
- 反叙事正则化。当前市场上流行的叙事是什么?你的结论是否恰好和流行叙事一致?如果是,需要额外警惕——从众的结论不一定错,但从众的推理过程往往偷懒。
残差驱动迭代
研究不会在一轮之后停止。残差——结论所需与证据所支持之间的差距——驱动下一轮研究。每一类残差代表一个维度的不足:
- 问题残差:问题本身还是正确的吗?研究过程中你可能会发现最初问的问题不是真正需要回答的问题。
- 约束残差:有未捕获的约束吗?随着研究深入,用户可能会意识到之前没提到的限制条件。
- 证据残差:缺失最小直接证据吗?结论的关键支撑是否都有证据背书,还是部分依赖推测?
- 假设残差:有未检验的竞争假设吗?除了你正在验证的假设,是否还有其他合理的解释?
- 对抗残差:有未回应的反驳论点吗?对立面提出的最强反驳是否已经被充分回应?
- 敏感性残差:有未探索的变量范围吗?关键变量的取值区间是否被充分覆盖?
终止条件:所有残差低于硬约束(每个维度都「足够好了」),或者再研究一轮的信息价值低于延迟成本(继续研究的边际收益递减到不值得等待)。这个终止条件防止了两个极端:过早收敛(还有明显的知识盲区就下结论)和无限递归(总觉得还不够完美,一直研究下去)。
在 Super Survey 中的实现
Semibot 的 Super Survey 技能实现了这个框架。每轮调研遵循分阶段循环:将用户的措辞构建为起点,通过自适应研究框架路由,在搜索之前先写好证据计划,用来源/声明/证据 JSONL 追踪来收集证据,对最强论点进行对抗性验证,综合出有条件判断,然后运行演化器来决定继续/收窄/转向/终止/定稿。
关键创新在于前置引导:在任何证据收集之前,技能先定义好目标、约束条件、决策关键变量、最小直接证据、隐含期望和反叙事正则化器。这可以防止 Agent 将提问者的预设立场直接当作目标函数。前置引导是整个框架中最重要的一环——它把「回答问题」变成「先搞清楚这个问题到底在问什么」。
局限性
- 需要用户能表达——或者愿意去发现——自己的约束条件。很多用户不知道自己的风险承受能力、时间偏好或机会成本。引导用户发现这些约束本身就是一个研究任务。
- 会增加研究开销。简单的事实性问题(「这个 API 的返回格式是什么?」)不需要这个框架。约束优化面向的是决策问题,不是查询问题。
- 残差指标使用粗糙的离散量表(0–3),而非经过校准的概率测量。这意味着残差的大小是近似值,用于判断「够不够好」而非精确量化。
- 对抗性验证可能会退化为稻草人论证——如果 Agent 没有认真对待对立观点,而是随便找几个弱理由反驳了事,对抗验证就失去了意义。
- 贝叶斯更新需要有意义的先验。如果先验完全无信息(「我对此一无所知」),更新结果会依赖证据到达的顺序而非内容。
- 这个框架是一个技能(skill),而非核心运行时。质量取决于模型能力和 prompt 工程。不同模型对复杂推理指令的遵循能力差异很大。
FAQ
能在金融领域之外使用吗?
完全可以。约束优化研究面向的是一切受约束的决策问题:产品机会评估(这个功能值得做吗?)、市场进入决策(应该进入这个市场吗?)、技术选型(用哪个框架?)、开源方案对比(选哪个数据库?)、尽职调查(这家公司值得投资/收购吗?)。只要问题涉及不确定性和个人约束,这个框架就有用。
这和「一步一步想」一样吗?
不一样。思维链(Chain-of-thought)提高推理的透明度——让你看到模型是怎么想的。约束优化改变的是目标函数本身——从「产出一个答案」到「构建一个决策系统」。思维链是推理方法,约束优化是问题定义。你可以用思维链来执行约束优化中的每一步,但思维链本身不保证你问的问题是对的、不保证你考虑了约束条件、不保证你做了对抗验证。
它总会给出决策吗?
不会。如果进一步研究的信息价值超过延迟成本,正确的输出是「继续研究」,而不是仓促建议。一个好的研究系统知道什么时候该说「我现在还不确定,但我知道需要什么信息来消除不确定性」。这比给出一个自信但缺乏依据的答案更有价值。
我能看到研究过程吗?
能。Super Survey 产出持久化的制品:简报(研究目标和约束摘要)、证据计划(要找什么、在哪里找)、研究记录(找到了什么)、头脑风暴(还有哪些可能)、对抗验证(反驳和回应)、综合报告(有条件判断)、演化器决策(下一步做什么),以及 JSONL 格式的来源/声明/证据文件。你可以随时回溯任意一步,检查推理依据。
这和调研工具有什么不同?
调研工具(如问卷平台、市场研究服务)收集数据。约束优化研究构建决策系统。调研工具的产出是数据摘要和统计结果;约束优化研究的产出是一组条件化行动方案——每个方案附带适用条件、证据强度、风险评估和关键假设。调研工具告诉你「数据说了什么」;约束优化研究告诉你「基于这些数据和你的约束,你应该做什么」。
需要多少轮迭代才能收敛?
取决于问题的复杂度和初始证据的质量。简单的对比问题(「A 和 B 哪个更适合我的场景?」)可能一到两轮就够了。复杂的决策问题(「我应该进入这个新市场吗?」)可能需要三到五轮。终止条件不是固定轮数,而是残差水平——当所有关键维度的不确定性都降到可接受范围以下时,研究就可以收敛了。
