商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > OpenSquilla发布0.4.0:AI写代码首次能“自我验证”

OpenSquilla发布0.4.0:AI写代码首次能“自我验证”

  发布于2026-08-20 阅读(0)

扫一扫,手机访问

说实话,AI写代码这回事,过去一年确实是突飞猛进,但一个核心问题始终没解:它改完了,到底能不能信?

这个问题,终于有人给出了一个务实的解法。6月30日,开源AI Agent项目OpenSquilla发布了0.4.0版本,核心更新是推出了编码工作流——coding模式。更关键的是,他们为AI编码引入了一套“自我验证”机制。什么意思?AI不再甩下一句“我改好了”就完事儿,而是在交回结果之前,先用自己的测试跑出一份能复核的、证明自己真改对了的证据。

OpenSquilla发布0.4.0:AI写代码首次能“自我验证”

这一下子,就戳中了AI编码目前最棘手的瓶颈——信任。

从行业角度看,过去这一年,AI写代码的能力进步确实快,但“能写”和“可信”之间,还隔着一条天堑。绝大多数编码Agent的做法是,改完代码就交差,至于对错,还得人一行一行地复核。这才是AI编码始终难以真正无人值守、规模化进入生产环境的根本障碍。现在,把验证环节本身也融入Agent的能力闭环,意味着行业评判AI编码的标准,正在发生一个微妙的转变:从“它声称自己改对了”,转向“它能否拿出证据自证改对了”。

具体怎么做?它的核心是一套独立的“红绿回归证据链”。流程是这样的:先写一个注定失败的测试用例,给问题定性,证明它确实能稳稳抓住这个bug;然后,再把功能做好,让这个测试从红色(失败)变为绿色(通过);最后,跑一遍项目原有的所有测试,确认新功能没有把其他地方搞坏。这三个关卡全部通过,才算交付。任何一关没过,直接打回。而且,还配套了一个默认的自动修复闭环。

最新公布的案例演示,很能说明问题。Coding模式在知名开源项目micrograd上跑了一次。micrograd是AI教育圈的顶流,由Anthropic研究员Andrej Karpathy打造,是一个极简的自动微分库。这次要新增的功能是“计算正确梯度”。要知道,梯度一旦算错,模型不会报错也不会崩溃,只会悄悄越学越偏——这是最典型、也最难靠肉眼发现的bug。演示分两步:先是AI走完上述“红→绿→回归”那三个关卡,自己交出证据;然后,由人类把micrograd的新功能和行业标准工具PyTorch,在同一道题上并排比对。结果呢?前向值与每一个梯度,小数点后10位完全一致。换句话说,这不是“AI自己说它对”,而是“它和最新的行业标准答案分毫不差”。

同期,OpenSquilla还推出了首个签名并公证的桌面安装包,macOS和Windows都可以双击安装,无需敲命令行。

OpenSquilla的主打方向是“提升单位成本的Agent智能”,切入点则是Learnable Harness。他们的目标是打造性价比最高的Agent产品。目前主流Agent框架普遍在推高模型调用成本,Token成本不断攀升,怎么压降成本,成了所有玩家共同的课题。OpenSquilla表示,在常规场景内测中,综合成本可以下降大约60%到80%。

公开信息显示,基元律动创始人王云鹤此前曾负责头部科技公司的大模型研发。这家公司成立仅数月就完成了首轮融资,是Harness和Agent原生模型方向上为数不多的代表玩家。而OpenSquilla上线后短短几周内,GitHub star就已经增长到数千的量级。

本文转载于:https://www.163.com/dy/article/L0OFNGCF053469RG.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注