展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > 独立研究者设计"形状代码测试台":让AI看图写程序,结果差强人意

独立研究者设计"形状代码测试台":让AI看图写程序,结果差强人意

一项研究测试了AI根据几何图形图片生成绘图代码的能力,使用ShapeCodeBench自动生成题目并评分。结果显示,简单场景下传统计算机视觉方法在精确匹配上占优;而在形状重叠的复杂场景中,AI模型凭借整体理解能力实现了更好的结构还原。


一项关于AI“看图写代码”能力的最新研究,以预印本形式发布于2026年5月,论文编号为arXiv:2605.11680。相关的数据集和代码存档于Zenodo,DOI为10.5281/zenodo.20132286。

想象一下这个场景:你面前有一张白纸,上面画着两个黑色圆形和一个黑色正方形轮廓。现在,要求你不去描述这幅图,而是写出一段计算机指令,让电脑能原样“画”出来。你需要精确地告诉电脑每个形状的位置、大小、是实心还是空心,精确到像素。这件事对人来说并不轻松,对AI来说,同样是个不小的挑战。

这正是ShapeCodeBench这项研究想要探究的核心——给AI模型看一张图,让它输出一段能还原这张图的绘图程序。研究者把这个任务称为“从感知到程序的重建”,简单说就是“看图写代码”。他们设计了一套完整的测试体系,用来衡量当前最顶尖的AI在这项任务上的真实水平。结果如何?答案是:远未达到完美,差距依然明显。

一、为什么需要专门建立一个测试台

在AI领域,要评估一个模型的能力,离不开精心设计的“考题集”,业内称之为“基准测试”。一套好的基准测试需要满足几个关键条件:评分标准必须客观、公正,不能因为答案的表达方式不同而误判;题目要能真实反映问题的难度层次;同时,它还需要具备可持续性,防止模型通过“背题”来获得虚高的分数。

现有的同类测试大多只满足其中一两个条件。例如,有些测试依赖人工评分,费时费力;另一些测试的题目一旦公开,就可能被模型“记住”,导致成绩失真。这就好比一套考试卷子流传出去后,学生背了答案再去考,分数自然漂亮,但实际能力并未提升。

ShapeCodeBench的设计者提出了一个巧妙的解决方案:利用随机数种子生成题目。每一道题都源于一个数字“种子”,只要更换种子,就能源源不断地生成全新的、从未出现过的题目。整个过程,从出题到评分,完全自动化,无需任何人工干预。这就像一台能自动出题、自动批卷的考试机器,想换一套新题,只需更换一个数字,整个过程不到一秒钟就能生成150道题。

二、这套考题具体考什么

整个测试建立在一套极其简洁的“绘图语言”之上。这套语言只有四条指令:画实心圆、空心圆、实心正方形、空心正方形。每条指令需要指定圆心或中心点的坐标、图形大小,空心图形还需指定线条粗细。画布固定为512×512像素的白底黑图,所有坐标和尺寸都是整数。

一道典型题目是这样的:给AI看一张图,图上可能有一个实心圆和一个空心正方形;AI需要输出两行代码,分别告诉电脑圆的位置和半径,以及正方形的位置、边长和线条粗细。系统会运行AI写出的代码,重新生成一张图,然后将其与原图进行逐像素对比,计算出差异。

评分体系涵盖了五个维度。最严格的是“完全匹配”,要求生成图与原图逐像素完全一致,差一个像素都不行。宽松一些的是“像素准确率”,统计一致像素的比例。另一个关键指标是“前景IoU”,它专门比较黑色图形区域的重叠程度,不受背景白色区域的干扰,更能反映形状位置和大小还原的准确性。此外,系统还会记录AI的代码能否被成功解析和执行,这两个指标用来判断AI是否犯了格式错误。

题目按难度分为三个级别。简单级别包含一到三个形状,形状较大,线条较粗,形状之间不重叠,也基本不会超出画布边界。中等级别包含三到六个形状,尺寸缩小,允许少量超出边界,形状之间可以靠近但边界框重叠不超过35%。困难级别则包含六到十个形状,尺寸进一步缩小,全部超出边界,并且强制形状之间存在重叠,没有重叠上限的约束。

这种分级设计的意图很明确:简单级别测试的是“AI能否正确识别和定位少数几个清晰的独立形状”,而困难级别测试的是“AI能否在形状互相叠压、部分超出画面的复杂场景下,还原出完整的程序”。

三、参赛的“选手”都有谁

研究者共测试了六套方案,其中两套是没有AI推理能力的基础对照组,另外四套是真正的前沿多模态AI配置。

第一套基础对照组是“空程序”,它的策略是无论看到什么图,都输出一个空字符串。这是一个纯粹的“底线”,用来确认任何有实质内容的系统都应该比它强。

第二套基础对照组是“传统计算机视觉启发式方法”。它不使用任何AI,而是依靠经典的图像处理技术来分析图片。具体流程是:先将图片二值化,然后找出所有连通的黑色区域,对每个区域计算其边界框的填充比例——如果黑色区域几乎填满了边界框,就判断为实心;如果只有边缘是黑色而中间是白色,则判断为空心。通过腐蚀操作进一步确认空心或实心,再用区域面积与周长之比来估算线条粗细。最后,将这些估算结果转换成对应的绘图指令输出。这套方法完全依赖几何计算,不涉及任何机器学习。

真正的AI选手共有四个配置,来自两家公司的两款顶尖模型。一款是Anthropic的Claude Opus 4.7,分别以“高推理强度”和“最高推理强度”两种模式参与测试。另一款是OpenAI的GPT-5.5,分别以“中等推理强度”和“超高推理强度”两种模式参与。

所有AI配置都使用完全相同的“零样本”提示,即不提供任何示例,只给出一句系统指令(“只返回合法的绘图代码,不要加代码块标记、注释或说明文字”)以及四个函数的格式说明。AI看到的就是图片加上这段说明,然后直接输出代码,没有任何“热身”或参考。

四、考试结果:各有各的短板

测试结果呈现出一幅清晰的“能力剖面图”,每套系统的强项和短板都暴露无遗。

先看最严格的“完全匹配率”指标。在整个150道题上,传统计算机视觉方法以8.7%的完全匹配率排名第一,GPT-5.5中等推理强度以2.7%排第二,GPT-5.5超高推理强度以2.0%排第三,Claude Opus 4.7两种配置的完全匹配率均为0%。空程序自然是0%。

这些数字看起来都很低,但不同难度级别下的对比才真正有意思。在简单级别,传统方法以26%的完全匹配率遥遥领先,而所有AI配置的最高完全匹配率也只有8%左右。到了中等和困难级别,传统方法的完全匹配率迅速跌落到接近零,而AI配置虽然也不高,但相对来说维持得更稳定一些。

这个“交叉”现象背后的逻辑很清晰。传统方法依赖“找到独立的连通区域”这一操作。当图上的形状彼此分离时,这个操作非常准确,每个形状对应一个独立的黑色区域,面积和位置都容易计算。但一旦形状开始重叠,两个或多个形状的黑色区域就会粘连成一片,传统方法便无法分辨“这一团黑色其实是两个形状叠在一起”,估算结果就会出错。AI模型则不依赖这种底层连通性,它能从视觉整体上理解“这里有两个圆,只是部分重叠”,因此在复杂场景下维持住了一定的结构感知能力。

再看更宽松的“前景IoU”指标。GPT-5.5超高推理强度以0.865的均值排名第一,GPT-5.5中等推理强度以0.850紧随其后,两个Claude配置约在0.44到0.46之间,传统方法则是0.583。在简单级别,GPT-5.5两种配置的前景IoU接近0.87,传统方法约为0.74,Claude两种配置约在0.41到0.44之间。

这里出现了第二个值得注意的对比:GPT-5.5在前景IoU上全面领先,但在完全匹配上却不及传统方法(在简单级别)。这说明GPT-5.5能够大致画对形状的位置和大小,但参数估算存在几个像素的误差,导致逐像素对比时无法完全吻合。换句话说,GPT-5.5的程序“差不多对了”,但没做到“完全精确”。

Claude的情况则不同。它的前景IoU在各个难度级别上都低于传统方法,说明它在还原形状的整体空间结构上,也不如传统的几何计算方法。这是一个更根本性的差距,不只是参数精度的问题。

关于代码格式的合法性,所有AI配置的解析成功率都相当高,Claude两种配置分别为98%和100%,GPT-5.5两种配置分别为97.3%和99.3%。出现的少量解析错误主要集中在两类问题上:坐标或尺寸超出合法范围,以及线条粗细超过了对应形状允许的最大值。这说明AI模型大多数时候能写出格式正确的代码,只是偶尔对参数范围的限制理解不够准确。

五、失败的形式各有不同

研究者对错误案例进行了系统分类,形成了一份“失败画像”。

对AI模型来说,失败主要分三类。第一类是“形状清单对了,参数差几个像素”,这在简单级别最常见。AI能识别出图里有一个实心圆和一个空心正方形,也大致知道它们在哪里,但圆心坐标写成了(245, 187)而实际是(248, 190),或者半径写成了78而实际是81。这种误差不影响视觉感知,却会让完全匹配失败。第二类是“遮挡场景下漏掉形状”,在困难级别,多个形状堆叠在一起,AI可能只识别出了外层可见的形状,而忽略了被遮挡的那些。第三类是“空心和实心搞混”,当线条特别细的时候,AI可能会把一个空心圆误判为实心圆。

对传统方法来说,失败的根本原因前面已经提到:形状连通成一片就没法拆分了。此外,它的线条粗细估算是用面积除以周长来近似的,这个公式在形状规整时还算准确,但遇到边缘不平整或者形状很小时,估算误差会变大。

从这些失败模式可以看出,简单级别其实隐藏着一个有趣的挑战:对AI来说,“看出形状在哪里”并不难,难的是“精确到像素级别地写出位置数字”。传统方法反而因为直接测量像素坐标而在简单场景下占优。但这种优势在形状开始重叠时就荡然无存了。

六、测试台的设计细节与可靠性保障

这项研究在可复现性方面的设计相当用心。评测集eval_v1包含150道题,按难度各50道,使用从0到49的连续整数作为种子生成。每张图片的SHA-256哈希值都被公开发布,任何人只要运行同样的生成代码就能得到完全相同的图片,可以验证自己得到的数据集是否正确。

代码解析器的安全性也经过专门设计。它基于Python的抽象语法树模块,但严格限制了允许的语法:只允许四种函数调用、只允许关键字参数、只允许整数字面量,不允许变量、循环、导入、属性访问等任何其他Python语法。这意味着AI无论怎么折腾,都无法通过代码注入或执行恶意操作,评测系统的安全性得到了保障。

渲染器使用的是Python图像处理库Pillow,具有完全确定性——同样的代码每次都会生成完全相同的图片。评测流程——解析代码、渲染图片、与原图对比——三个步骤全部自动完成,无需人工介入。

在测试不同AI配置时,研究者给Claude使用了Claude Code命令行工具,给GPT-5.5使用了OpenAI Codex命令行工具。每道题设置了超时时间,失败时最多重试两次。每次运行都会把完整的请求内容、原始输出、归一化后的预测、延迟时间和详细评分结果保存到文件中,方便后续核查和复现。

七、研究的边界与尚未触及之处

研究者在论文中明确列出了当前版本的几个局限,这种坦诚的态度值得肯定。

首先,当前版本只有黑白两色,这带来一个隐藏效果:后画的形状无法覆盖或擦除先画的形状,只能叠加。这意味着绘图顺序在当前版本中实际上不影响最终结果,评测无法考查“先画什么后画什么”这类顺序推理能力。如果未来引入多种颜色或者“清除”指令,绘图顺序就会变得重要,测试难度也会大幅上升。

其次,当前绘图语言只有四种图形,没有矩形、直线、多边形、曲线等。这是一个刻意的简化,目的是让失败原因更容易定位,但也意味着测试不能反映对更复杂图形的理解能力。

再次,所有测试都是零样本的,没有给AI任何示例。提供几个例子,或者让AI先思考再回答,可能会显著改变结果,但这些实验没有包含在当前版本中。

此外,研究中没有测试人类在这项任务上的表现水平。没有人类基准,就很难直观判断“这个任务到底有多难”——是普通人看一眼就能写出来的水平,还是需要专业知识和大量时间的水平?研究者计划在后续版本中补充这一对比。

最后,模型推理本身存在随机性,所以即使用完全相同的图片和提示,两次运行也可能得到不同的代码。研究者公开了每次运行的配置参数和全部原始输出,使其他人可以尝试复现,但不能保证数字精确一致。

说到底,ShapeCodeBench最有意思的地方,不是某个具体的数字,而是它揭示了一个反直觉的现象:在最简单的场景下,一套完全不用AI的传统计算机视觉方法,比当今最顶尖的多模态大模型还要准确;而在复杂场景下,情况又反了过来。这说明“看图写代码”这件事,目前的AI既不是彻底不行,也没有做到真正好用——它处于一种介于两者之间的奇妙状态。

传统方法好比一个只会用直尺量形状的工人,在没有遮挡时量得很准,但一旦形状叠在一起就束手无策。AI模型更像是一个有整体理解能力的人,能大致看出图里有什么,但在精确报出每个像素坐标这件事上还不够稳定。如果能把两者的优点结合起来——用AI理解整体结构,再用精确计算细化参数——或许能在两个维度上同时取得更好的结果。这也是研究者隐含在设计中的一个研究方向暗示。

这套测试台的最终价值,在于它提供了一个可以持续使用的“考场”。只要换一组种子,就能出一套新题,不用担心AI通过“背题”作弊,也不需要请人来标注或评判。对于想追踪多模态AI在结构化视觉理解上进展的研究者来说,这是一个随时可以抽查的工具。目前最好的完全匹配率只有8.7%,最好的AI前景IoU是0.865,距离“基本解决这个问题”还有相当大的距离,测试台远未饱和。

Q&A

Q1:ShapeCodeBench测试的是什么能力?

A:ShapeCodeBench测试的是多模态AI模型“看图写绘图代码”的能力。具体来说,是给模型看一张包含圆形和正方形的黑白图片,要求模型输出一段能完整还原这张图的绘图程序,然后把程序运行出来的图片与原图进行逐像素对比打分。

Q2:传统计算机视觉方法为什么在简单场景下比AI更准确?

A:传统方法通过直接测量图像中各个独立黑色区域的像素坐标和面积来估算形状参数,在形状互相分离时,测量结果非常精准。AI模型虽然能大致识别形状的位置,但在精确到像素级别写出坐标数字时,存在几个像素的误差,导致完全匹配失败。简单场景下形状不重叠,传统方法的直接测量优势得以充分发挥。

Q3:ShapeCodeBench如何防止AI通过背题刷高分?

A:ShapeCodeBench的每道题目都由一个数字种子生成,只需更换种子就能生成全新的题目集合,整个过程完全自动,不需要人工标注或评判。研究者将这种能力称为“可再生性”,任何人随时可以用新种子生成全新的测试题,让AI无法通过记忆已有题目来获得虚高分数。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关 AI
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。