Home / Academicabin2026-05-19 · 系统发育

为什么我不再相信单一的「最佳树」


很长一段时间里,系统发育分析的交付物是一棵树:一棵拓扑确定、支持率标注在节点上的「最佳树」。它看起来像一个结论,也一直被当结论用。

但严格说,它是一次估计。同样的数据,换一个替换模型,拓扑可能变;换一套基因过滤阈值,拓扑可能变;把比对里模糊的那几段删掉,拓扑还是可能变。这些变化不是错误——它们反映的是数据里真实存在的不确定性。「最佳树」这个说法的危险之处,在于它暗示剩下的可能性已经被排除了,而实际上它们只是没被展示。

我现在怎么做

至少给出三样东西:不同过滤策略下的拓扑差异、节点支持率的分布而不只是均值、以及明确说明哪个节点的结论对方法选择敏感。如果一个节点在八种处理里稳定,那是可以相信的;如果它在三种处理里各长一个样子,那这个位置就是当前数据回答不了的问题,应该写「未解决」,而不是挑一个写上。

一个反直觉的收获

把不确定性画出来之后,文章反而更好写了。因为读者不再需要去猜哪些部分是我有把握的,哪些是我赌的。隐藏不确定性通常被理解为「让结论显得更强」,实际上它只是把审稿人和读者的注意力从结论转移到了方法细节上——他们会开始怀疑所有东西,包括你真正有把握的那些。

一棵带着误差棒的树,比一棵干净的树说了更多实话。

← 回到全部文章