批判性思维:如何检验一个说法

批判性思维不是长期怀疑一切,不是辩论技巧,也不是背下一堆拉丁文标签。它是一套提问习惯:对方到底主张什么,什么情况下这个主张才成立,同样的证据还有别的解释吗,什么会改变我的信心。我的看法很直接:挑出一个谬误很容易,把对方的主张重建成最强、可检验的版本,才是真正的活。

🎙️ 发布并录制于: ·

01把事实、推断和意见分开

大多数争论都把「看到了什么」和「我怎么讲这件事」混在一起。给每一句话贴个标签。事实能对着证据核对。推断是从事实出发的解释或预测。意见表达的是偏好或评价。推断和意见并不该被禁止,只是它们不能借用观察那种确定感。

FACT       38 of 100 invited users completed signup.
FACT       Last month, 51 of 100 completed it.
INFERENCE  The new identity step may have reduced completion.
OPINION    The extra verification is worth the lost signups.

Missing before causal confidence:
traffic mix · device mix · outages · experiment assignment · sample size
故障会议上的原话

「服务器慢,是因为数据库扛不住我们的流量。」把这句话拆开。「响应时间中位数从 220 毫秒涨到 1.8 秒」是观察。「数据库导致的」是推断。去查数据库等待时间、应用链路追踪、上线变更和网络延迟。那次故障真正的原因,是应用里的一个重试循环。把推断当成事实,直接把第一个上手的工程师送到了错误的系统。

02把前提和结论摆出来

论证不是吵架,它是由前提支撑的一个结论。把一段话改写成编号的句子。然后分开问两个问题:这些前提是真的吗?如果它们都为真,能支撑这个结论吗?形式正确的论证可以建立在假前提上。前提全为真,也可能推不到它声称的结论。

Statement: “We should cancel Friday support because few tickets arrive.”

P1  Only 3% of weekly tickets arrive on Friday evening.
P2  Staffing Friday evening costs $1,200 per month.
P3  Delaying those tickets until Monday creates no serious harm. UNTESTED
C   Therefore, cancel Friday evening support.

Test P3: severity, response promises, churn risk, and timezone.
The argument turns on P3, not on the easy 3% statistic.

要专门去找那些被省掉的桥梁,比如「而且这点差异很重要」「所以这个方案最优」。很多时候大家对摆在眼前的事实并没有分歧,真正在打的是一个没说出口的价值判断或预测。把这座桥写出来,真正的分歧才能拿上桌讨论。

03举证责任在提出主张的人身上

提出主张的人,要给出与后果和意外程度相称的证据。「你倒是证明我错啊」是在调换这个责任。没被驳倒,不等于成立。低风险的小实验,举证标准可以放低。涉及指控、医疗说法或者不可逆的改动,就要求得高得多。

“This supplement removes brain fog. Prove that it doesn't.”

Ask instead:
1. What outcome does “removes” mean, measured how and when?
2. Compared with placebo, sleep, or no treatment?
3. How many participants, selected and blinded how?
4. Was the study preregistered and replicated?
5. Who funded it, and what harms were tracked?

No evidence means “not established,” not automatically “false.”
一次真实的会上交锋

「我听说那个外包把路线图泄露出去了。」「能把消息记录拿出来吗?」「拿不出来,但你也证明不了她没干。」这个指控关系到一个人的饭碗。补救办法:先停止把这个说法继续往外传,找到最初的当事人,保留访问日志和消息时间戳,问清楚什么证据能区分真泄露和一句猜出来的传言,在事实查清前一律用中立措辞。笃定不能替代证据。

04相关只是线索,不是原因

两件事一起变动时,能讲通的故事有好几个:A 导致 B、B 导致 A、有第三个因素同时导致两者、是筛选造出来的、或者纯属偶然。时间线有帮助,但「之后」不等于「因为」。要去找机制、对照组、剂量反应、自然实验,以及主动设计的检验。

Claim: “Sales rose after the rebrand, so the rebrand worked.”

Competing explanations:
• holiday demand rose
• prices fell 12%
• a large reseller launched
• old ads kept converting
• measurement changed

Better test:
compare exposed and unexposed markets, keep price constant,
inspect channel-level lift, and define the success metric in advance.
一张图把结论反了过来

一位负责人说:「用过帮助中心的用户留存更好,所以把每个卡住的用户都推过去。」第一步,看时间。大部分访问发生在用户已经把配置搞定之后。第二步,只比较处在同一配置阶段的用户,留存差距几乎消失了。第三步,做一次随机推送实验,推送并没有提高留存。用帮助中心,某种程度上是进展的信号,而不是进展的原因。

05先看基础比率,再检查样本

一个生动的案例让人觉得有信息量,是因为它细节多。先问这个结果本来多久发生一次,再听那个特别的故事。然后检查:谁进了样本,谁中途退出了,测的到底是什么,这个样本像不像主张里说的那个人群。

Test claims 90% sensitivity and 95% specificity.
Condition affects 1 in 100 people.

Among 10,000 people:
100 have condition → 90 true positives
9,900 do not       → 495 false positives

A positive result is about 90 / 585 = 15% likely to be true
before other evidence. The low base rate matters.
失败案例:只有满意的人回答了

一篇产品文章声称「92% 的客户愿意推荐我们」。问卷只在用户走完五星好评流程之后才弹出;1.8 万活跃客户里有 184 人作答。补救办法:公布回收率和触达路径,与满意度无关地抽样,联系没作答的人,把作答者和整体客户群做对比,并且别再把 184 个自己选进来的人不加限定地叫作「客户」。

06谬误是用来修论证的,不是用来记分的

别把批判性思维变成词汇比赛。喊出「稻草人」或者「人身攻击」,并没有回答对方的主张。用平实的话说出哪一步走歪了,把论证重建起来,再去要那块缺失的证据。一个标签只有指向具体修法时才有用。

“You opposed the last redesign, so your accessibility concern is wrong.”
Repair: the speaker's history does not test the contrast data.
Measure contrast and keyboard navigation.

“Either ship Friday or admit we cannot execute.”
Repair: those are not the only options.
Compare Friday, staged Monday, and delayed full release.

“Three competitors use it, so it must be safe.”
Repair: popularity is not a security audit.
Inspect threat model, permissions, incidents, and controls.

有时候一个人的利益关系或者专业背景确实相关。但这仍然不等于可以拿人品替代证据。请把这层利益冲突为什么会改变你给的权重讲清楚,然后回过头去检验主张本身。

07先把对方观点补强,再反对

用对方能接受的说法,把他立场里最强的那个版本讲出来,包括他的证据和他在意的东西。请他确认一遍。然后再去批评这个版本。这不是礼貌表演,它能防止你赢下一个根本没人提出过的主张。

Original: “We should not add mandatory two-factor login yet.”

Straw version:
“You don't care about security.”

Steelman:
“You agree account takeover matters. You expect mandatory setup
now to lock out users who share devices and lack reliable phone
access. You want recovery tested before enforcement. Correct?”

Now test: takeover rate, lockout rate, recovery completion,
alternative factors, pilot population, and launch threshold.
一场变得可检验的争论

当时的原话是:「照你的方案,就是让所有账号一直暴露着。」而对方提的其实是先给管理员上通行密钥,再做一轮账号恢复流程的试点。补救办法:把这个顺序复述一遍,请对方确认,指出双方共同的目标,然后把分阶段推进期间的预期损失,跟立即强制启用带来的预期锁定量放在一起比。分歧于是变成了两份预测,而不是一次忠诚度测试。

08问一句:什么情况会证明它是错的

一个有用的事实主张是敢于失败的。如果不管出现什么结果都能被解释成支持,这个主张就没法指导行动。在看到结果之前,先定好哪个观察、哪个阈值、哪个日期会降低你的信心。「我看到就知道了」,等于把事后的裁判权交给自己的偏好。

Claim: “The onboarding tour reduces first-week confusion.”

Before launch:
Metric: support contacts tagged setup per 100 new accounts
Comparison: randomized tour vs no tour
Success: at least 20% fewer, with no drop in activation
Failure: difference under 5% after 2,000 eligible accounts
Review: 2026-09-01

Also collect interview evidence for problems the tag misses.
会移动的靶子

一位活动负责人预测转化会提升 15%。结果是下降 2%,于是他说这次活动「建立了认知」。可从来没定过任何认知的衡量口径。补救办法:把最初那份预测留档,明确说转化预测错了,把「建立认知」当成一个新主张,在下一次活动之前先定好衡量口径,并且禁止事后再挑成功指标。

09更新信心,而不是来回站队

相信一件事,很少是开关式的。给你的信心一个大致的数字或者区间,预先说清什么证据会推动它,然后按证据的鉴别力去更新。一项弱研究不该把百分之十变成百分之九十。一次预测失败,应该比一段模糊的传闻更能推动你。

Claim: vendor can meet the June migration date

Prior from similar projects:                 35%
Detailed plan passes independent review:     50%
Pilot migrates 95% of messy records:         70%
Key engineer leaves; no replacement named:   48%
Second pilot fails permission mapping:        25%

Record why each update moved. Do not fake precision;
“20–30%” is honest when the evidence is rough.

问自己一句:「如果这个主张是错的,我还会预期看到这条证据吗?」两种情况下都会出现的证据,几乎不该推动你。也留意不对称的更新:如果支持的轶事都算数,失败的预测却从来不算,那是身份在替你护着这个信念。

10先给身份降温,再跑一遍检验流程

愤怒、恐惧、自尊和群体归属感,说明这件事对你有多重要,但它们不构成主张成立的证据。当一句话威胁到你的身份时,先停一下,别急着去搜。写下来:如果同样的主张是对方受益,你会接受什么当证据。先私下批评,再公开表态。目标不是变得没有情绪,而是别让情绪碰到证据的开关。

CLAIM-TESTING CHECKLIST
□ Write the exact claim. Define slippery words.
□ Label facts, inferences, and opinions.
□ List premises and the conclusion. Find the hidden bridge.
□ Put the burden of proof on the claimant.
□ Ask what else could produce the same observation.
□ Check base rate, sample selection, denominator, and missing data.
□ Trace important evidence to its source.
□ State the strongest opposing case and get confirmation.
□ Define what would lower confidence before seeing results.
□ Give current confidence and update size, with reasons.
□ Name the identity or incentive that makes this hard.
□ State what remains unknown and what action is justified now.
一句好用的降温句

一次气氛紧张的评审上,有人说:「你要是真在意客户,就该支持这个退款政策。」停。把身份之争翻译成一个可检验的分歧:「我们的分歧是,这个政策能不能在不引发承受不起的滥用的前提下,减少对客户的损害。」把损害、滥用、成本和时间区间都定义清楚。再去比几个政策选项。在不在意客户是共识,有争议的是那份预测。

我的原则:不要问一个人「逻辑是不是清晰」。要问的是,这个主张、出自这个人,能不能通过这次检验。思维好的人照样会为糟糕的想法辩护。让人不舒服的人照样可能带来真证据。

Tell me what missed

A correction is more useful than a compliment. This goes straight to the person who writes SwiftGrasp.

Was this page useful?
0/1000

Please do not include passwords, private keys, or personal information.