LongCat AI通过“生成即标注”实现长文引用智能匹配,依托LongCite-45k数据集微调、百万级上下文支持、原生嵌入式引用格式及LongBench-Cite闭环评测,确保引用正确性与定位精度。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

LongCat AI 实现长文中引用来源的智能匹配,核心在于“生成即标注”——不是靠事后检索或额外模块补加,而是让模型在生成回答的同时,原生输出带精准位置标记的引用。这种能力不依赖外部RAG或后处理,而是通过数据与训练方式的根本性设计来达成。
细粒度引用标注数据驱动微调
模型并非凭空学会标引用,而是用专门构建的高质量标注数据集 LongCite-45k 进行监督微调(SFT)。这个数据集里每一条样本都包含:原始长文档、用户问题、标准答案,以及答案中每一句话所对应的原文句子级出处(精确到段落+句序,甚至字符偏移)。模型在训练中被强制学习“说某句话,就必须同时指出它来自原文哪一句”,从而内化引用逻辑。
支持百万级上下文,确保原文完整可见
引用匹配的前提是原文不能丢失。LongCat-2.0 原生支持 100 万 Token 上下文,意味着整份合同、整本技术手册、整套代码仓库都能一次性喂给模型。没有截断,就没有信息缺失;没有分块,就避免了跨块引用错位。模型始终在完整语境中定位依据,而不是靠拼凑片段猜测。
引用格式直接嵌入输出,无需解析后处理
模型输出不是“先写答案再加注释”,而是自然融合引用标记。例如:
“违约金不得超过实际损失的30%[DocA, §3.2, 句4],该比例符合《民法典》第584条精神[DocB, p.17, 第2段]。”
这些标记由模型自主生成,位置准确、格式统一,可直接用于可信展示或下游校验,省去人工对齐或正则提取的步骤。
评测闭环保障引用质量
引用是否靠谱,靠 LongBench-Cite 自动评测:GPT-4o 会逐句检查两点——
- 这句话在原文中是否存在对应表述(正确性)
- 标注的位置是否真能支撑该结论(定位精度)
评测结果反馈回训练,持续优化模型对“依据强度”和“文本忠实度”的判断能力。

















