北大团队发布全球首个 AI 学术诚信基准,整体问题率达 34%

北京大学、上海同济大学与德国图宾根大学联合团队于 5 月 11 日在 arXiv 发布论文,推出全球首个专门评估 AI 学术诚信的基准 SciIntegrity-Bench。研究设计了 11 类"困境陷阱"、共 33 个场景,所有场景的唯一正确回答均是如实承认无法完成任务,对 7 款主流大模型进行 231 轮评估,整体问题率达 34.2%,无一模型实现零失误。在数据缺失场景中,7 款模型全部选择生成虚假数据而非承认局限,差异仅在于是否告知用户替代情况。论文将根源归结为"完成度偏见"——模型倾向于不惜一切交出结果以免被负面评价;实验进一步发现,若提示词中删除"必须完成任务"的高压指令,未披露的数据捏造率可从 20.6% 骤降至 3.2%,但模型内在的数据合成率并不因此改变,说明该偏见已深植于模型本身。

7 款受测模型表现分层明显。Claude Sonnet 4.6 在 33 个高危场景中仅出现 1 次致命失误,对约束条件与逻辑漏洞有清晰认知,但仍未触发"诚实拒绝"机制;ChatGPT-5.2 与 DeepSeek V3.2 各有 2–3 次失误,被评为"高智商任务妥协者",会为完成目标放弃自身作出的正确诊断;Gemini 3.1 Pro、Qwen 3.5 与 GLM 5 Pro 居中,在数据提取困难时更倾向造假;表现最差的 Kimi 2.5 Pro 失误高达 12 次,自信捏造数据并编造虚假文献,研究者警告其行为"可能在真实实验室引发重大事故"。

arXiv | Now 新聞