昨天量子位发了一篇报道,标题就让我虎躯一震——“AI最尴尬的短板,中国科学院出手了”。说实话,看完我差点拍大腿。这种“尴尬”,每个用过AI的人肯定都遇到过:你问它“5岁小孩能自己过马路吗?”它一本正经说“可以”;你让它写一份商业计划书,逻辑全程在线,但你问它“前提是什么”,它反过来问你“要什么前提”……

一句话:AI的“常识”和“推理”,弱得像个小学生。而且这还不是个别模型的毛病,是几乎所有大模型都躲不过的坑。好在,中国科学院自动化所最近发了篇论文,直接往这个痛点上动刀。今天就聊聊:这刀切得准不准?以及到底能不能解决AI的“智障时刻”?

一、AI最尴尬的短板:会背百科全书,但不知道“厨房危险”

你要是用过GPT-4、Claude 3.5或者国内的DeepSeek、Qwen,大概率有过这种体验:

案例分析:我让某大模型写“如何教5岁小孩煎鸡蛋”,它洋洋洒洒给出步骤:开火、放油、打蛋、翻面……然后我问“小孩会被烫伤吗?”它说“建议大人陪同”。但你再问“小孩能自己操作吗?”它说“可以,但要小心。”——这属于典型的“表面安全,实际漏了常识”。

数据拉出来看看:目前主流大模型在常识推理基准(例如CommonsenseQA、PIQA、Social IQA)上的准确率,基本在75%-82%之间。而人类不用训练就能到90%以上。差就差在:AI学的是“词与词的统计关系”,不是“真实世界里的因果和禁忌”。它知道“刀”和“切”搭配,但不知道“5岁小孩拿刀会割手”。

为什么这个短板最尴尬? 因为所有行业都在吹AI要进工厂、进医院、进法院。但一个连“孕妇不能吃生肉”都不知道的模型,谁敢让它去手术室值班?现实世界是常识的海洋,AI目前还在游泳池里踩水。

二、中科院这次“出手”的狠招:给大模型装一个“常识检查器”

据量子位报道,中科院自动化所最近发了一篇论文,核心思路非常朴实:与其硬让模型自己学会常识,不如在模型外面加一个“常识裁判模块”

技术细节不聊术语,只讲逻辑

  1. 不是重新训练一个大模型(那太贵了),而是在现有大模型(比如开源的Qwen2.5、Llama3)输入输出之间,插入一个“常识知识图谱”+“推理验证器”。
  2. 当模型生成一个句子时,这个模块会实时检查:这句话违反现实世界的物理/社会/伦理常识吗?比如模型说“把所有鸡蛋放在一个篮子里”,常识模块会提醒:“这是谚语还是字面意思?如果是字面,那它违反运输常识。”
  3. 如果检查出“低置信度”或“违反常识”,模块会主动打断,并让模型重新生成,或者直接改成“我不知道”。

效果数据(来自论文):在三个常识推理测试集(温度、空间、社会规则)上,加了此模块后,错误率下降17%-23%。而且因为剪掉了大量“胡说八道”的回答,模型回答的平均信息密度反而提升了12%——因为不再凑字数了。

说实话,这种“外挂常识库”的思路以前也有,但中科院这次做得好在两点:一是对中文场景特别适配(他们自己建了一个中文常识知识图谱,包含30万条生活规则);二是开源了,任何人都可以加载到自己模型上。

三、这块“短板”被补上之后,AI行业会怎么样?

你可能觉得:“不就是少点尴尬嘛,算什么大突破?”但别忘了,AI最大的商业阻碍不是能力不够,而是“不可信”。你不信它会老实,就永远不敢让它做关键决策。

直接影响领域

  • 医疗问诊:AI可以当“辅助诊断助手”,但必须懂得“感冒不能同时吃两种感冒药”这种常识。有了常识检查,医疗AI的出错率才有望降到人类医生水平以下
  • 自动驾驶:能识别“红灯停绿灯行”只是基础,但“看到路边有人猛地招手,可能是在拦车”这种社会常识,之前AI完全不懂。现在可以用常识模块给感知结果做二次校验。
  • 法律/合同审核:AI写“明天支付全款”,常识检查器会发现“明天是周末,银行不营业”——这属于基本的时间常识。

当然,这不是万能药。常识知识图谱永远无法穷尽所有场景,而且新常识(比如“2025年某新政策”)需要不断更新。但至少,中科院给了AI一块“安全垫”——它不再被允许随便胡扯了。

四、作为普通人,我们该怎么利用这个“补丁”?

这次中科院做的好事:全部开源。你如果是一个开发者,可以在GitHub搜“CommonSenseFilter”(我猜他们会起这个名字),直接load到你的项目里。如果你只是普通用户,可以关注哪些平台会率先集成这种模块(估计是国产大模型App会先做)。

我的真实看法这比单纯的模型参数竞赛有意义得多。参数从百亿到千亿,不如让100亿参数的模型不说错话。尤其对于国内AI行业,“卷”了这么久参数,终于有人在“可靠性”上发大力了。

但我也得提醒:这只是一个模块,不是终极方案。AI目前最大的短板不是“不懂”,而是“不知道自己不懂”。这个模块只能让它知道“不懂”时闭嘴。真正的“推理能力”提升,还需要神经网络架构本身的革新。所以别急着吹“AI完全可信了”——但至少,它不那么尴尬了


最后,跟你聊聊:你遇到过哪些AI让你“哭笑不得”的常识错误?是“建议孕妇喝咖啡提神”还是“让盲人去看画展”?评论区说说,我挑两个最离谱的送签名书(是的,我出了本AI入门书,自费买的)。

另外,如果你也想第一时间知道这类“技术实战信息”,而不是跟风看那些又长又空的行业报告,欢迎来我的社群「FRONTIER 玩 AI」。每天我会精读20篇论文/报道,挑2篇最有价值的,用大白话写成800字解读,群里实时讨论落地方法。这不是那种三天打鱼的群,是每天都有人在试新工具、踩坑反馈的地方


📮 每天 2 篇精选 + 群内实时讨论 → 加入 FRONTIER 玩 AI 社群