☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

开源 AI Agent 项目 OpenSquilla 近日正式推出 0.4.0 版本,最大亮点在于上线全新编码工作流——coding 模式,并首次为 AI 编程能力引入“自我验证”机制:AI 不再满足于“我已修复”的单向输出,而是在提交结果前,主动运行测试生成可追溯、可复现的证据链,用数据证明“确实改对了”。
该机制直击当前 AI 编程落地的核心痛点——可信度缺失。尽管过去一年 AI 编码能力持续跃升,但“能生成”远不等于“可信赖”:多数编码 Agent 在完成修改后直接交付,正确性仍需人工逐行审查,这成为阻碍其真正实现无人值守、规模化投入生产的关键瓶颈。将验证能力深度嵌入 Agent 自身逻辑,标志着行业对 AI 编程的评估范式正发生根本转变——从“它声称完成了”迈向“它能否自证完成得正确”。
其实现路径是一条闭环的“红绿回归证据链”:首先编写一个必然失败的测试用例,精准定位问题、确认 AI 具备 bug 识别能力;随后完成功能修复,使该测试由红转绿;最后执行项目原有全部测试套件,确保改动未引发副作用。三重校验全部通过方可交付,任一环节失败即触发自动回退。同时配套两大能力:一是默认启用自动修复闭环——失败即重试,直至通过为止;二是隔离式开发环境——所有修改均在独立副本中进行,仅当验收达标后才合并至主干代码。
在官方实测案例中,Coding 模式被用于为知名开源项目 micrograd(由 Anthropic 研究员、AI 教育领域标杆人物 Andrej Karpathy 开发的极简自动微分库)新增“精确计算梯度”功能。此类 bug 极其隐蔽:梯度一旦出错,系统既不报错也不崩溃,而是 silently 偏离正确方向,几乎无法通过肉眼或常规调试发现。整个过程分为两阶段验证:第一阶段由 AI 独立走完“红→绿→回归”全流程,并自动生成完整验证报告;第二阶段由人类工程师将 micrograd 新增功能与业界黄金标准 PyTorch 在同一数学任务上并行比对——前向传播结果及所有梯度值,小数点后 10 位完全一致。这意味着,结论并非来自 AI 的自我宣称,而是与其权威参照系达成毫秒级精度对齐。这也是继团队发布新一代评估基准 claw-swe-bench 后,在 Coding Agent Runtime 领域的又一次关键落地实践。
与此同时,OpenSquilla 正式发布首个经过数字签名与公证认证的桌面安装包,支持 macOS 和 Windows 双平台,用户仅需双击即可完成安装,彻底告别命令行依赖。
OpenSquilla 的核心使命是“提升单位成本下的 Agent 智能密度”,以 Learnable Harness 为技术支点,致力于打造最具性价比的 Agent 解决方案。面对主流 Agent 框架普遍推高模型调用量、token 成本持续攀升的现状,OpenSquilla 通过本地化智能路由策略——依据任务复杂度动态匹配最优模型、技能模块按需加载、记忆检索按上下文触发、工具返回结果前置结构化处理等方式,在请求发出前即完成多维成本优化。据硅星人此前报道,实测数据显示:其智能路由相较通用网关 OpenRouter,路由准确率高出约 4.4 个百分点,整体调用成本降低约 75%;在与旗舰级大模型执行相同任务时,输出质量基本持平,但成本差距达约 9 倍。OpenSquilla 官方披露,常规使用场景下内测综合成本可下降 60–80%。
项目背后团队由基元律动创始人王云鹤领衔(曾主导头部科技公司大模型研发),CTO 为韩凯。OpenSquilla 上线数周内 GitHub Star 数迅速突破数千;公开信息显示,公司成立仅数月便顺利完成首轮融资,已成为 Harness 架构与 Agent 原生模型赛道中极具代表性的新兴力量。

















