LongCat AI通过YaRN扩展位置感知、LoZA稀疏注意力降低计算开销、N-gram嵌入表加速语义匹配三方面协同优化,实现百万级token知识库检索既准又快:YaRN稳定建模超长距离依赖,LoZA支持1M token输入且预填充提速50%、解码省算力30%,N-gram提升专业术语匹配鲁棒性。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

LongCat AI 解决知识库检索中的上下文长度限制,不是靠“硬塞更多文本”,而是从模型架构、注意力机制、上下文组织方式三个层面协同优化,让长文档检索既准又快。
用 YaRN 扩展位置感知能力,让模型真正“看懂”长序列
传统 RoPE(旋转位置编码)在扩展到 128K 或 256K 上下文时容易失真,导致模型混淆远距离词的关系。LongCat-Flash-Lite-FP8 采用 YaRN 方法,动态调整旋转基频(如 rope_theta=10000000.0),并配合 max_position_embeddings=131072 的配置,使模型能稳定建模超长距离依赖。这意味着:
- 检索时,关键词与它在文档末尾的定义、上下文中的反例,仍能被准确关联;
- 不再需要把一份合同拆成几十段再分别提问,模型可端到端理解整份文件的逻辑结构。
用 LoZA 稀疏注意力降低计算开销,支撑百万级 token 实时检索
全注意力在 100K+ token 场景下计算量爆炸(O(N²)),而 LongCat-Flash-Exp 引入 LoZA(ZigZag 稀疏注意力),将约 50% 的 MLA 模块替换为流式稀疏模块(SSA),形成“全局块 + 局部窗口”交错结构:
- 每个 1024-token 窗口内保留 1 个全局块抓整体语义,7 个局部块盯细节;
- 预填充阶段提速 50%,解码阶段算力节省 30%,实测支持 1M token 输入;
- 在知识库 RAG 场景中,可一次性注入数百页 PDF 原文 + 多轮用户追问 + 工具返回结果,不截断、不降质。
用 N-gram 嵌入表加速语义匹配,缓解 MoE 的 I/O 瓶颈
知识库检索常需高频查词、短语、命名实体。LongCat 的 N-gram 嵌入表预先缓存常见子词组合(如“GDPR 第 17 条”“PCI-DSS 合规审计”),相比传统 FFN 路由 MoE 层:
- 减少重复计算和显存搬运,推理延迟下降明显;
- 对专业术语、缩写、长命名实体更鲁棒,避免因切词不准导致漏检;
- 支持在低资源环境下(如单卡 A100)稳定运行 128K 检索任务。
不复杂但容易忽略:这些技术不是孤立起作用的。YaRN 让模型“能读”,LoZA 让它“读得快”,N-gram 让它“读得准”——三者叠加,才让 LongCat 在真实知识库场景中做到“一次上传、多次深问、全程不丢上下文”。

















