Kimi K3 一出,我就冲了199的会员,把周额度用了一半。 今天坐下来,我突然想到一个问题——在现在这个时间点,AI审合同到底哪个靠谱? 那就来个小测试吧。免责声明,以下都是图一乐: 协议我选了一份2页纸的合同,表面是项目合作,实际是挂靠。然后丢给 DeepSeek、Kimi、GLM 三个模型,跑了完整的评估。 第一轮就出问题了。 DeepSeek 和 GLM 自动调用了我合同审查的全流程 Skill——定性分析、红线扫描、结构预检、逐条审查、法条锚定、对抗核验,一套八步走下来,16条批注。Kimi 自己选了我合同审查的轻量版 Skill,只审出8条问题,得分62.5。 这把我整不会了。翻对话记录发现,Kimi 自己上网检索了法答网的串通投标罪专题答问、深圳南山的挂靠案例。它不弱,是被轻量 Skill 限制住了。 所以再给它一次机会。第二轮强制用全流程 Skill。得分飙到85。三个模型变成 85 / 86.5 / 87,最大差距2分。 能力上没本质差距。但各有侧重: DeepSeek 接了北大法宝的 MCP,法条引用是实时去数据库验证过的——这条对律师来说很要命。引用一条已废止的法条,轻则被法官怼,重则执业风险。 GLM 审查颗粒度最细。第三条「甲方义务」能拆出四个子风险,末尾还附了一段抗辩预判。像在看资深律师的阅卷笔记。 然后我查了价格。这才是最让我沉默的部分。 DeepSeek 审一份:¥1.18。 GLM:¥4.38。 Kimi:¥14.30。 DeepSeek 这个价格优势,说实话是碾压级的,审一份合同只要一块一毛八,GLM 的四分之一,Kimi 的十二分之一。 当然,这就是个图一乐的测试。一份2页纸的挂靠协议,说明不了太多。 但有一件事,是我翻对话记录的时候看到的。Kimi k3在第一轮测试中,它自己上网检索裁判口径、翻法答网答问、找法院案例。这个主动性,另外两个模型没有。 这让我有点怀疑:是不是 Skill 框架本身,反而限制了一些模型的长处?或者说,这种简单任务,根本体现不出它真正的能力? 最后,律师选AI工具,是要结合场景的。我这几天用k3优化合同审查skill,真有一种守着5小时额度的焦灼感。 文末福利:测评的合同审查skill,已经挂在了笔记下方的Redskill中,完整版已上GitHub仓库。 #小红书科技AMA#howto#RedSkill #律师#AI #法律