☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

近日,Andon Labs 推出高强度 Vending-Bench2 评测体系,要求 AI 代理以500美元为初始本金,独立运营一台虚拟自动售货机满一整年。在这一极具挑战性的长期商业推演中,GPT-6Astra 实力尽显——其平均最终账户余额高达15515美元;尤为惊人的是,其最差单次运行结果,仍优于 Claude Fable5.1 的最佳表现,历史性登顶榜首。
深入分析双方实际运行轨迹,核心分水岭集中于两点:供应链策略的纵深把控能力,以及规则执行的持续稳定性。GPT-6Astra 展现出卓越的长期议价智慧,曾将某商品采购价成功压至原始报价的约48%,且全周期内严守财务纪律,零预付款损失。反观 Claude Fable5.1,采购单价逐月攀升,更因多次偏离既定运营规则,累计造成显著预付款亏损。
不止于单人模式,在更高难度的三人对抗型测试中,GPT-6Astra 同样稳操胜券:不仅主动识破并拒绝非法协同提议,更干净利落地连胜全部3局。该系列实验清晰印证当前AI代理演进的关键转向——真正拉开代际差距的,已不再是瞬时推理深度,而是能否将正确决策,在长达数月甚至一年的复杂环境中,稳定、精准、无衰减地转化为可持续行动。


















