LongCat AI通过ChartNet数据集、VLM双路径解析及Image-Editn局部编辑能力,实现图表语义感知、结构化重建与动态更新。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

LongCat AI 解决图表信息识别与分析问题,核心在于结合专用数据集、多模态建模能力与任务导向的指令理解机制,不是靠通用视觉模型“硬看”,而是构建了一套从数据到推理的闭环方案。
ChartNet 数据集提供高质量训练基础
它不是泛泛地学“认图”,而是依托 MIT 与 IBM Research 联合发布的 ChartNet——一个专为图表理解设计的百万级多模态数据集。该数据集包含 420 万合成图表、9.4 万人工验证样本和 3 万真实图表,覆盖柱状图、折线图、饼图等 24 种类型,以及 Matplotlib、Seaborn 等 6 种主流绘图库输出样式。这意味着模型在训练阶段就大量接触真实图表结构、坐标轴逻辑、图例位置、数值标签排布等细节,建立起对图表语义的深层感知。
VLM(视觉语言模型)支持图表重建与表格提取双路径
LongCat 的图表理解不满足于“描述图里有什么”,而是能反向还原结构化信息:
- 输入一张截图或 PDF 中的图表图像,模型可生成对应的数据表格(如行列标题、数值矩阵);
- 同时支持重建图表的可编辑版本(如 SVG 或代码形式),保留原始样式与逻辑关系;
- 对含中文图例、单位标注、多级坐标轴的金融/科研图表,也能准确解析文本内容与数值映射关系。
LongCat-Image-Editn 支持图表局部精准编辑与动态更新
当需要修改图表而非仅识别时,模型能理解自然语言指令并执行“外科手术式”操作:
- 比如“把蓝色曲线替换成红色虚线,并将图例文字‘Q1销量’改为‘2024年一季度’”;
- 修改过程锁定非目标区域(坐标轴、网格线、标题等),确保风格一致、文字渲染自然;
- 中文图例识别与重写能力经过专门优化,避免字体错位、字形模糊等问题。
与 VitaBench 2.0 的长期建模能力形成互补
虽然 VitaBench 主要面向智能体行为评测,但其对用户偏好演进、上下文连续性的建模思路,也反哺了图表理解场景——例如,当用户多次要求“对比上月数据”,模型能关联历史图表中的时间维度与指标定义,而非孤立处理每张图。
不复杂但容易忽略。

















