Capybara模型训练数据需按五步准备:一、明确多模态对齐需求与任务类型配比;二、爬取网页、整合arXiv/YouTube、接入私有设备数据;三、分模态清洗图像、视频、文本;四、跨模态去重并按任务加权配比;五、序列化为protobuf格式,按模态掩码分片存储并生成索引。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您正在为Capybara模型准备训练数据,但不确定所需的数据规模与构成方式,则可能是由于缺乏对多模态模型数据配比和清洗标准的清晰认知。以下是完成Capybara模型训练数据准备的具体步骤:
一、理解Capybara的数据需求特性
Capybara并非传统单模态语言模型,而是一个支持文本、图像、视频混合输入的统一多模态架构。其训练数据必须覆盖跨模态对齐样本,例如带图文描述的短视频、图文并茂的网页快照、含时间戳字幕的视频帧序列等。数据量不能仅以token计,还需兼顾图像分辨率(建议≥224×224)、视频时长(建议1–30秒)、帧率(≥15fps)及文本长度(平均≥32 token/样本)。
1、确认任务类型:若目标是T2I(文本生成图像),需至少100万图文对;若为T2V(文本生成视频),则需不少于50万带动作标注的短视频片段;若需支持I2V(图像生成视频),则必须包含同一主体在不同时间步的连续帧序列,单序列长度不低于8帧。
2、核查模态对齐质量:每条样本中,文本描述须精确对应图像内容或视频关键帧,禁止使用通用caption模板(如“一张图片”);视频样本需附带逐帧语义标签或动作动词序列(如“打开门→走入房间→放下包”)。
二、构建跨模态原始数据集
原始数据必须来自真实、多样、低噪声的多模态来源,避免合成数据主导导致泛化能力下降。需同步采集文本、视觉、时序信息,并保留原始结构关系(如HTML中的alt文本、video标签的description属性、社交媒体帖子的图文嵌套结构)。
1、爬取公开多模态网页:使用trafilatura配合自定义解析器提取Common Crawl中含<img>与相邻段落、<video>与<figcaption>组合的HTML文档,过滤掉广告区与导航栏包裹的内容。
2、整合专业平台资源:从arXiv抽取含图表与图注的论文PDF,用pdfplumber提取图像+LaTeX caption;从YouTube Data API获取含自动字幕(auto-captions)与缩略图的公开视频,确保字幕时间轴与关键帧对齐误差<0.5秒。
3、接入私有数据源:若具备车载记录仪或监控系统数据,导出H.264编码视频流+同步IMU传感器日志+人工标注的动作事件时间戳(如“急刹”“变道”),构建设备原生多模态三元组。
三、执行模态级清洗与过滤
清洗必须按模态独立进行,再做跨模态一致性校验。图像需剔除模糊、过曝、低分辨率样本;视频需丢弃卡顿、黑帧率>5%、音频缺失的片段;文本需删除机器生成痕迹明显(重复n-gram占比>15%)、长度<8字符或含不可见Unicode控制符的内容。
1、图像清洗:使用OpenCV计算Laplacian方差,剔除<100的模糊图像;调用CLIP-ViT-B/32提取图像嵌入,对余弦相似度>0.98的重复图像仅保留高分辨率版本。
2、视频清洗:用ffmpeg抽帧(1fps),对每帧运行上述图像清洗流程;统计连续黑帧数量,剔除黑帧段长度>总帧数10%的视频。
3、文本清洗:加载fasttext语言检测模型,移除非目标语言文本(如训练中文Capybara则剔除英文占比>70%的样本);使用正则匹配过滤含“[Photo]”“[Image]”等占位符的无效caption。
四、实施跨模态去重与配比控制
去重必须在图文对/视频-文本对粒度执行,防止模型因重复模式过拟合。同时需强制维持各模态数据在训练批次中的出现频率平衡,避免文本主导或视觉稀疏问题。配比应依据下游任务加权,而非均等分配。
1、图文对去重:将图像经ResNet-50提取特征向量,文本经BERT提取[CLS]向量,拼接后使用FAISS检索余弦相似度>0.95的近邻对,仅保留发布时间较早者。
2、视频-文本对去重:对视频提取I帧特征序列(每秒1帧),与文本embedding做DTW(动态时间规整)对齐,距离<0.3的视为重复,保留视频码率更高者。
3、设定模态配比:若主任务为图文生成,则图文对占65%,视频-文本对占25%,纯文本(用于语言建模预热)占10%;若主任务含视频理解,则视频-文本对提升至45%,图文对压至40%,纯文本维持15%。
五、组织数据格式与存储结构
最终数据必须组织为可被PyTorch DataLoader直接加载的格式,禁止使用未压缩的原始文件树。所有样本需序列化为protobuf格式(.tfrecord或.parquet),内含严格schema字段,确保模态字段原子性与可索引性。
1、定义schema:每个样本必须包含image_bytes(JPEG压缩后≤2MB)、video_bytes(H.264 Annex B格式,关键帧间隔≤50)、text_utf8(UTF-8编码,长度≤512)、modality_mask(3位二进制,如“110”表示含图文无视频)。
2、分片存储:按模态掩码值哈希分片,每片不超过10GB;图文对存入shard_110_0001.parquet,视频-文本对存入shard_101_0001.parquet,确保分布式训练时各worker负载均衡。
3、生成索引文件:输出index.jsonl,每行含shard_path、offset(字节偏移)、length(样本字节长度)、modality_mask,供Dataloader随机访问时跳过解码开销。

















