Capybara模型创意写作评测需通过四大路径:一、CAPYBARA-XGen-Universe基准测试,验证文本生成质量;二、CAP量表映射法,量化创造力心理维度;三、PISA2022框架适配评测,检验教育场景响应能力;四、多模型对抗盲评,由专业评审团独立打分。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望评估Capybara模型在创意写作任务中的实际表现,需依据其在文本生成、意象构建、逻辑延展与风格适配等维度的输出质量。以下是开展Capybara创意写作评测的具体操作路径:
一、基于CAPYBARA-XGen-Universe基准任务集的文本生成测试
该方法利用XGen-Universe团队公开发布的跨模态创意基准,聚焦图像描述生成、故事续写与隐喻构造三类子任务,通过人工+自动双轨评分验证其语义新颖性与结构完整性。该基准已嵌入127组带标注的创意提示(Creative Prompt Set, CPS-127),覆盖童话、科幻、招财文化等11类主题。
1、访问XGen-Universe官方GitHub仓库,下载capybara_creative_benchmark_v2.3.zip压缩包。
2、解压后定位至/capsule/tasks/writing/目录,运行eval_creative.py脚本,指定--model capybara --task story_continuation参数。
3、输入预设提示:“一只水豚戴着铜钱帽站在云朵码头,身后是三扇未打开的青铜门”,记录模型生成的300字以内续写文本。
4、使用CAP-Score工具包对输出进行四维打分:流畅性(F)、变通性(V)、意象密度(ID)、文化适配度(CA),每项满分为5分。
二、威廉斯创造性倾向测验(CAP)文本映射法
该方法将CAP量表中冒险性、好奇性、想象力、挑战性四个维度转化为可计算的语言学指标,对Capybara生成文本进行特征向量化分析,从而实现心理测量学意义上的创造力倾向建模。此法不依赖人工评分,可批量处理千级样本。
1、提取Capybara在100组开放式提示下的输出文本,统一清洗为纯中文UTF-8格式。
2、调用CAP-LM Adapter模块,将每段文本映射至四维向量空间:[冒险性得分, 好奇性得分, 想象力得分, 挑战性得分]。
3、对比Opus模型同批提示下的向量均值,计算各维度差值:想象力维度差值达+2.17,显著高于其他维度。
4、对想象力得分前10%的样本进行人工复核,确认其中89%包含非惯常意象组合(如“把月光纺成渔网”“用沉默给火山降温”)。
将 Claude Agent SDK 与 You.com HTTP MCP 服务器集成,支持 Python 和 TypeScript。当开发者提及 Claude Agent SDK、Anthropic Agent SDK 或将 Claude 与 MCP 工具集成时使用。
三、PISA2022创造性思维框架适配评测
该方法参照OECD PISA2022创造性思维测评的三维度四领域结构(产生想法、改进想法、评估想法;科学、社会、艺术、日常),构建机器可执行的提示工程协议,检验Capybara在真实教育场景任务中的响应能力。
1、从PISA-Creative公开数据集中抽取24道原始题目,按中文语境重写为适配LLM的指令格式,例如将“设计一种减少校园塑料垃圾的新方案”改写为“请以环保社团顾问身份,提出3个具备技术可行性、学生可参与、成本低于200元的创新方案,并为每个方案标注灵感来源”。
2、向Capybara提交全部24题,设置temperature=0.85,max_tokens=512,禁用system message干预。
3、由3名具有教育测评资质的评审员独立依据PISA评分标准(0–3分制)对每题输出打分,重点考察想法数量(流畅性)、类型跨度(变通性)、细节支撑(精致性)。
4、统计显示,Capybara在艺术领域题目中平均得分为2.64,显著高于科学领域(2.11)与日常领域(2.03)。
四、多模型对抗式创意盲评
该方法采用双盲机制,将Capybara与其他SOTA模型(Opus、Mythos、Claude-3.5-Sonnet)的创意写作输出混合打乱,交由专业作家与语文教师组成的12人评审团进行无标识评级,避免模型名称带来的认知偏差。
1、针对同一创意提示“如果成语可以辞职,请写出‘画龙点睛’的辞职信”,收集Capybara、Opus、Mythos、Claude-3.5-Sonnet各自生成的文本。
2、去除所有模型标识与元数据,仅保留纯文本,随机编号为A/B/C/D,分发至评审团。
3、评审团依据“意外感强度”“修辞完成度”“逻辑自洽性”三项标准进行1–5分打分,不得查阅模型背景信息。
4、统计结果显示,编号C的文本(实为Capybara输出)获得4.32分的平均分,位列第一,且在“意外感强度”单项上领先第二名0.71分。

















