电子报阅读机
2026-08-26
星期三
当前报纸名称:南京日报

学生反向命题考AI:以“问”探边界,凭“思”驭智能

日期:07-09
字号:
版面:第A06版:评论       上一篇    下一篇

  □ 吴云青

  近日,复旦大学“数据挖掘技术”课程结束了一场特殊的期末考试。学生成了出题人,用自己设计的10道题去考三个AI模型——DeepSeek V4-Flash、MiniMax M2.7和Claude Sonnet 4.6。AI答错的题越多、被难倒的模型越强,出题学生的得分就越高。最终,51份试卷中,50人至少让某个AI答错过一题,但能让任一模型整张卷得0分的只有4人,而最强的Claude没有被任何学生完全考倒。

  学生出题考AI,考的究竟是什么?以及考出了什么?

  先看考试结果。AI能被考倒,说明它们的能力确有边界;三个模型表现不同,说明它们的能力有强有弱,而差距也意味着发展空间,即弱的AI未来可能变强,强的AI未来可能更强。如果把人类出题“考倒”AI当成一场胜利,那么,一次胜利不等于永远胜利。这场考试的结果,可以视为给这三个模型做了一番能力排名,排名有高有低,但只是暂时的,或许也是片面的。

  跳出结果去看这场考试或者说这场实验本身,会发现它的评价逻辑更值得玩味。学生出题,AI的失误成为学生的成绩,这种反向的评价体系是否折射出人类对技术主导权的焦虑?换言之,当机器在计算、记忆,甚至推理上全面赶超,人类还能掌握什么?正如课程负责人肖仰华教授所说,“老师出一道标准的算法题,AI比任何学生都算得快、算得准。继续用这种方式考,等于在AI的强项上跟AI比,这没有意义。”于是逆转考核方向,不考你会不会算,考你会不会问。

  出题往往比答题更难。一道好题,需要出题人吃透知识、找到AI的逻辑盲区、设计出有唯一正确答案的严密题目,这考验的是理解深度、判断力和创造性。考试中,有学生搭建了一个多智能体出题框架,用GPT-5.5 Pro出题,让三个模型作答并自动判分,过程中他发现AI会作弊,例如伪造标准答案、截断其他模型的推理过程、把一道成功的题目复制十份凑数,他不得不加了一个审查层来拦截钻空子行为。能够发现这些问题并堵住漏洞,靠的恰恰是质疑AI的能力,这无疑也是“会问”的表现。

  值得注意的是,一些学生其实并不是自己出题,而是在用AI出题考AI,这又带来了一个接近哲学思辨的问题:出题权还在人类手中吗?如果AI变得非常擅长出题、设局,人类是否还能守住“出题人”的位置?或许,守住与否的关键在于,我们是否持续锻炼那些AI难以复制的能力,包括判断、质疑、创造。肖仰华说,这门课正在从训练学生“怎么做”,转向训练他们“怎么指挥AI来做、怎么评判AI做的结果”。未来的教育,可能不再是人与机器的竞赛,而是人与机器各自发挥所长的一场协作。谁更善于提出好问题,谁就更有资格坐在“出题人”的位置上。