当前位置:

首页 > 硬件相关 > 李海大学等五所高校联手:AI能否像老师一样看懂学生的错误思路?

李海大学等五所高校联手:AI能否像老师一样看懂学生的错误思路?

AI能读懂孩子的数学草稿吗?这项研究给出了耐人寻味的答案 2026年3月,一份由李海大学、松鼠AI学习、中科院自动化所等五所知名院校联合完成的研究,被发布在arXiv预印本平台上(编号:arXiv:2603.24961v1)。这项研究做了一件挺有意思的事:它第一次系统地探究了那些“多才多艺”的多模态

AI能读懂孩子的数学草稿吗?这项研究给出了耐人寻味的答案


2026年3月,一份由李海大学、松鼠AI学习、中科院自动化所等五所知名院校联合完成的研究,被发布在arXiv预印本平台上(编号:arXiv:2603.24961v1)。这项研究做了一件挺有意思的事:它第一次系统地探究了那些“多才多艺”的多模态大语言模型,到底能不能像人类老师一样,读懂学生手写数学作业里的错误。想刨根问底的读者,不妨用上面的编号去搜搜看原文。

想象这么一个画面:孩子的数学作业本上,写满了数字,涂涂改改,算式东倒西歪。家长看了可能一头雾水,但经验丰富的老师却能一眼看穿——错在哪里?为什么错?孩子的思路卡在哪个环节了?现在,研究人员正试图让人工智能也获得这种“透视”能力。

一、破译手写密码:AI面临的第一道难题

孩子的手写草稿,对AI来说无异于一部天书。数字“7”带个小勾,除号写得像加号,涂改的墨团掩盖了关键步骤……这些对人类老师而言,经过训练和经验的积累尚可解读,但对AI模型来说,却是第一道难以逾越的鸿沟。

研究发现,现有的AI在处理手写数学符号时,表现得像个“近视眼”。举个例子,学生在计算4÷35时,可能因为不熟悉小数除法,在过程中错误地移动了小数点,最终得出一个相距甚远的答案8.75。人类老师能顺着草稿的笔迹,还原出学生的思维路径,判断出这是小数计算技能薄弱所致。然而,AI往往连那些潦草变形的数字和符号都识别不准,更别提追踪背后跳跃的逻辑了。

更复杂的是格式问题。数学草稿从来不是印刷体,上面有随意画的圈、箭头、旁注。这好比在一张凌乱的地图上找路线,人类老师能凭经验分辨哪些是正式步骤,哪些是草稿涂鸦;而AI则很容易被这些“噪声”干扰,完全误解学生的意图。

数据很能说明问题:即便是表现最好的AI模型,视觉识别错误率也高达36%。这意味着超过三分之一的情况,AI连学生写了什么都没看清,后续的分析自然无从谈起。

二、从表象到本质:错误分类的精妙艺术

即使AI勉强“看清”了内容,更大的挑战才刚刚开始:理解错误的本质。这有点像中医辨证,同样是“答案错误”,背后的“病因”却各不相同。

研究团队将数学错误精细地分成了七大类。比如,“程序性错误”是步骤执行出了岔子;“计算错误”是具体运算时“手滑了”;而“逻辑推理错误”最为棘手,好比下棋时战略思路从根上就偏了,步步皆错却看似合理。

不同年龄段的学生,错误模式也大不相同。小学生的错误主要集中在题目理解和基础计算上,这两类加起来能占到70%,像刚学做菜的新手,不是看错菜谱就是放错调料。中学生则更多地在复杂计算和概念理解上栽跟头。

有趣的是,AI对不同类型错误的诊断能力也参差不齐。对于有明确外在特征的“抄写错误”,AI识别尚可;但面对需要深度理解的“逻辑推理错误”,AI就显得力不从心。

三、思维追踪:AI能否读懂学生的心思

识别符号是技术活,理解思维则是认知层面的高难度动作。这就像侦探破案,不能只看现场,还得推演出完整的作案动机和过程。

来看个实际案例。题目问:“小明4分钟做了35道题,平均每道题用多少分钟?”正确答案应是4÷35≈0.11分钟。但有学生答了8.75。人类老师扫一眼草稿就能发现,学生把除数和被除数弄反了,这暴露了他对“平均时间”概念的误解。

AI在处理这类问题时,常犯两种毛病:一是“过度推理”,自己脑补出学生根本没犯的错误;二是“表面诊断”,只能指出答案不对,却说不到错误的根子上。

另一个反直觉的发现是:AI在处理小学低年级简单题目时的表现,有时反而不如处理中学复杂题目。原因可能在于,小学生的书写更随性,解题思路也更跳跃,缺乏规范的步骤展示,这让习惯结构化工序的AI更难以捉摸。

四、数据背后的故事:1720份真实作业的启示

这项研究最可贵的一点,是它基于真实的、原汁原味的学生作业。团队从海量样本中,最终筛选出1720份涵盖一到九年级的数学草稿,覆盖了数字、方程、几何、应用、统计五大领域。

数据标注采用了“人机协作”的严谨模式:先让AI初判,再由五位资深的数学老师最终审核修正,确保标签的可靠性。这个过程,有点像医院的专家会诊。

数据分析揭示了一些鲜明的趋势:小学阶段,理解和计算错误是重灾区;到了中学,随着知识变难,概念理解错误的比例显著上升。此外,人类专家之间对于错误判断的一致性超过了90%,这为评估AI设定了一个明确的高标准。

五、AI大比拼:16个模型的表现如何

研究团队拉来了16位“AI教师”同台竞技,阵容豪华,从开源翘楚到商业明星,包括Qwen2.5-VL、GPT-4o、Gemini 2.0 Flash等。

比拼结果可谓喜忧参半。在“错误原因解释”这项核心任务上,表现最优的模型(o4-mini)准确率在70%左右。但请注意,人类老师的标杆在87%以上。这意味着,最顶尖的AI仍落后人类近20个百分点。

而在更精细的“错误分类”任务上,差距被进一步拉大:最好的AI准确率仅40%出头,人类老师则轻松超过78%。这好比一个医生,或许能看出你生病了,但具体是什么病,却经常误诊。

六、失败案例解剖:AI到底错在哪里

为了找到病根,研究团队深度剖析了100个典型失败案例。

首要问题依然是“看不清”(视觉识别失败,占36%)。学生写的“-3÷(-6)=1/2”,在AI眼里可能变成了别的符号组合,第一步就错了。

其次是“看不懂格式”(占15%)。草稿上的箭头、圈画、涂改,这些人类老师能自动过滤的辅助信息,却经常让AI晕头转向。

此外,“幻觉”(占16%)和“错位解读”(占17%)也很常见。AI有时会无中生有,编造学生没犯的错误;或者虽然看到了所有步骤,却无法将它们按正确的逻辑顺序串联起来,还原不出真实的思考轨迹。

七、不同数学领域的挑战差异

AI的能力也存在“偏科”现象。它在几何与测量、统计与概率这类步骤相对规范、答案相对唯一的领域表现较好。然而,一旦遇到方程与函数这类需要多步、复杂逻辑推理的题目,AI就颇为吃力了。

应用数学题目则呈现两极分化:对于有固定套路的“行程问题”,AI尚能应对;一旦题目涉及现实建模和开放假设,AI就容易“死机”。这恰好暴露了当前AI在处理真实世界复杂性和灵活性上的短板。

八、年级差异揭示的认知模式

另一个有趣的发现是AI表现的“年级效应”。在解释错误原因时,AI的表现随年级升高而轻微下降,可能是被高年级题目的内在复杂性难住了。

但在给错误分类时,趋势却完全相反:AI对高年级作业的分类准确率明显更高。原因在于,中学生的解题过程更规范、步骤更清晰、书写更工整——这相当于给AI提供了一份更标准的“普通话”文本,当然比解读小学生的思维“方言”要容易。

九、商业化模型与开源模型的较量

在这场比拼中,商业化模型(如o4-mini)整体上显著领先于开源模型,这背后是数据质量、算力投入和工程优化的综合优势。尤其是在需要深度推理的任务上,那些专门强化了推理能力的模型(无论是商业还是开源的)表现都更突出,这说明理解学生错误,光靠“看”还不够,核心在于“想”。

当然,开源模型也有亮点。比如在某些特定领域(如统计概率),个别开源模型的表现甚至不输商业模型,显示了其在垂直领域训练的独到之处。

十、实际应用的前景与挑战

尽管目前AI还不能媲美人类老师,但其应用前景已然清晰。首先,它可以成为老师的“超级助教”,高效完成作业的初筛,让老师能聚焦于最需要人工干预的复杂案例。

其次,在推动个性化学习上潜力巨大。AI若能精准诊断每个学生的独特思维误区,就能生成量身定制的学习报告和练习,实现“对症下药”。

当然,挑战依然严峻。技术上,手写识别与深度推理能力有待突破;教育理念上,则需警惕过度依赖技术而削弱师生间宝贵的人文互动与情感连接。如何让AI真正成为“助攻”而非“主角”,是未来教育智能化必须深思的课题。

说到底,这项研究揭示了一个核心事实:理解人类写在纸上的、充满跳跃和涂改的思维过程,其复杂程度远超我们的想象。从潦草字迹到逻辑误区,这中间需要跨越的不仅是技术鸿沟,更是认知鸿沟。

不过,这项研究的价值恰恰在于此。它搭建了一个坚实的评估基准,提供了高质量的真实数据集,为后续的探索铺平了道路。或许在不远的将来,每个孩子真的能拥有一位永不疲倦、即时反馈的AI学习伙伴,那无疑将为教育的个性化与公平性,打开一扇全新的大门。

Q&A

Q1:ScratchMath数据集包含了哪些内容?

A:它包含了1720份来自中国中小学的真实数学手写草稿,覆盖一到九年级,涉及数字与表达式、方程与函数等五大数学领域。每一份都包含了原始手写过程和经过专家标注的错误分类信息。

Q2:当前最先进的AI在理解学生数学错误方面表现如何?

A:即使是顶级模型,在解释错误原因上的准确率也仅在70%左右,远低于人类老师的近90%水准;在错误分类任务上,差距更大,AI约40%的准确率与人类近80%的水平相比,仍有很长一段路要走。

Q3:AI在分析学生数学错误时主要面临哪些困难?

A:主要困难有三:一是视觉识别关,难以准确辨认潦草、不规范的手写符号;二是格式理解关,容易被涂改、圈画等非标准布局干扰;三是逻辑推理关,难以深入追踪并理解学生多步骤解题过程中的根本性思维误区。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

上海链家安住APP:业主主动卖房功能与成交数据解析
上海链家安住APP:业主主动卖房功能与成交数据解析

本文解析上海链家推出的“安住APP”功能,该工具允许业主在贝壳/链家挂牌后主动管理房源。通过实时查看销售进展、发送看房邀约及获取AI策略,业主可缩短成交周期。数据显示试点期间平均成交7天,最短1天。适用于希望提高信息透明度、主动参与卖房过程的业主。

打破流量垄断,让平台经济释放普惠红利
打破流量垄断,让平台经济释放普惠红利

2026年6月工信部等七部门印发《促进平台经济大中小企业协同发展行动方案》,明确平台经济是数字技术赋能的实体经济。针对流量垄断与“数字租金”问题,专家主张治理重心应从静态整改转向推动平台能力向中小企业外溢,通过算法透明、接口开放及数据可迁移,打破封闭生态,实现创新与规范并重的高质量发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。