← 云舒 yunshu文章开源产品
探索 · AI 实验

用 AI 占卜两周,我想给玄学做个 benchmark

· 云舒 yunshu

过去两周我沉迷用 AI 占卜,做了一次蛮有意思的探索,今天来做个复盘,和大家分享一下这个有意思的事情。

前两周脑子里有几个问题在思考,突然想要么尝试一下占卜吧,看看能不能给我一些启发和思考。于是我尝试了塔罗牌、雷诺曼、六爻三种占卜逻辑。

我自己本身算一个业余的八字爱好者,系统性地学过一次命理(没学会),然后听过倪海厦老师的天纪,再从自身的成长和身边人的汇总中,能够证明命运逻辑确实存在。这是前提背景——因为我认同命运可以被观测到逻辑,所以我觉得理论上可以通过回溯 + 验证,构建一套用 AI 验证未来的逻辑。

从「不可量化」到选定六爻

我先用塔罗牌和雷诺曼做了测试,但这俩测试下来我感觉好像没法量化,就是针对不同的问题看起来怎么解读都行。我和 AI 最后决定还是弄个好量化点的逻辑出来。于是我们选择了六爻作为占卜工具,通过爻的变化来看更多信息,从而更精准地断事情。

基于六爻的占卜工具,AI 和它的 subagent 做了调研,产出了第一版解读逻辑;我则梳理了一些我已经知道答案、可以做验证的 benchmark。

三轮测试:准确率与「问题本身」的失真

第一轮测试发现并没有很高的准确率,AI 讲的逻辑经常互相对不上。校核后发现,可能是我的问题提得不准确——我脑子里想问的,和我最后问出来的,在表达时会有失真。所以我增加了「AI 润色问题再去占卜、再去解卦」的流程。

第二轮开始测,我发现一些问题对得上了,整体的卦象和问题的发展趋势是可以对上的。但这时候我出现了一个困惑:回溯的问题看起来都对上了,那我怎么能证明这不是个随机函数、未来的问题也对得上呢?理论上最好要对未来的问题进行校验才知道,但实际上我也不知道这个问题什么时候能校验。严格来讲,只有足够大的样本集 + 测试集验证后,我们才能证明这套逻辑可用。现在就卡在测试集的验证上。

第三轮测试,我让 Codex 从多个维度 review 了一下解卦逻辑,发现之前的一些逻辑是错的,于是做了二次优化,增加了起卦日子的地支和天干本气来计算五行的能量,看看能不能增加准确率。结果样本集一切岁月安好、看起来跟我给的答案差不多,测试集一如既往地我回答不上来。

结论:有些事情,难点在「答案和卦象都难以量化」

扔了两个礼拜、几百卦,扔不动了。我觉得这个逻辑还是没法量化,很难构建一套系统来进行高准确率解读。主要原因在于答案和卦象都难以做量化——卦象很多时候表达的是一个「象」,比如「冬天大雪纷飞」,解读难度其实是很大的;而人生活中的答案往往也没那么非黑即白,可能多个东西耦合在一起。

系统建立的核心,是能否构建有效的评测集和验证集,也就是 benchmark。如果这个事情就是没法被量化,就像八字和占卜——不是说它不准,是这个事情的解读本身没法量化,不是 1+1=2,就跟人心一样,永远是多变的、难以揣摩的。

我觉得还是炒股更容易做量化:输入一个答案必然会输出一个结果,然后做个准确率校核就行,还有大量公开和模拟数据可以运算,多么天然有效、适合程序计算的场景啊。AI+炒股看起来比 AI+占卜更容易量化一点,之后做个探索尝试,看看 AI 能不能自己给我赚钱。

本文整理自作者发布在即刻 @云舒的AI实践笔记的动态。