PixTV不内置模型,而是通过API路由调用外部T2V或I2V服务;二者输入结构不同,不可混用;应按镜头类型分流、用Ref2VA统一源或以LTX2.3为双模态枢纽,并通过Network面板验证URL路径一致性。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想在PixTV里稳定生成连续漫剧镜头,却在文生视频和图生视频之间反复切换模型,结果角色脸型不一致、动作卡顿、转场崩坏——这不是提示词问题,而是模型选型逻辑错了。
先看PixTV底层怎么调用模型
PixTV本身不内置视频生成模型,它是一个工作流调度平台,所有AI能力都通过插件或API接入外部模型服务。你看到的“文生视频”和“图生视频”两个按钮,背后连接的是不同地址、不同协议、不同输入结构的远程推理端点。
点击文生视频按钮时,PixTV把你的提示词+参数打包成JSON,POST到类似 https://api.pixtv.ai/v1/t2v 的接口;点击图生视频按钮时,则走另一条通道,例如 https://api.pixtv.ai/v1/i2v,这个接口强制要求上传base64编码的图片文件,并校验图片尺寸与格式。
这两个端点可以指向同一个物理模型(比如都调用Wan 2.2),也可以指向完全不同的模型(如t2v走MiniMax H3,i2v走LTX2.3)。PixTV不做绑定,只做路由。
为什么不能强行共用一个模型
文生视频模型(T2V)和图生视频模型(I2V)的输入结构存在不可绕过的语义鸿沟:T2V的文本编码器专精于解析动词时序、镜头变化和隐含物理关系;I2V的视觉编码器则必须对齐输入图的像素级构图锚点、边缘梯度分布和局部纹理频谱。把一张图硬塞进T2V接口,模型会因缺失文本语义而随机补全;把纯文字丢进I2V接口,服务直接返回400错误。
【PixTV的I2V入口会拒绝接收空图像字段】,哪怕你在前端删掉图片预览框,后端校验仍会拦截请求。这不是UI限制,是API协议层的硬性约束。
实际项目中怎么选型
方法一:用Ref2VA能力统一控制源
如果你已部署MiniMax H3本地服务,可将其同时注册为PixTV的t2v和i2v后端。关键操作是:在t2v请求中加入"reference_image"字段(即使为空base64),触发H3的Ref2VA模式;在i2v请求中传入同一张参考图+相同提示词。这样两个通道实际共享同一套时空对齐逻辑,角色一致性提升明显。
方法二:按镜头类型分流调用
封面镜头、高光动作戏用图生视频(如即梦API),确保角色姿态精准;环境空镜、过渡镜头用文生视频(如通义万相),节省绘图时间。PixTV画布中右键节点→“更换模型源”,可为每个视频节点单独指定后端。
方法三:用LTX2.3做双模态枢纽
LTX2.3原生支持text+image联合输入,在PixTV中配置其API时,将t2v和i2v两个入口都指向同一个LTX2.3服务地址,仅通过请求体中是否存在"image"字段自动切换模式。该方案需自行修改PixTV插件配置JSON,路径为~/.pixtv/plugins/video/config.json。
验证是否真正在用同一个模型
第一步:在PixTV画布中新建一个文生视频节点,输入提示词“少女转身微笑”,不上传图,点击生成→记录返回的job_id;
第二步:新建一个图生视频节点,上传同一张“少女正面静帧图”,提示词保持完全一致,生成→记录新job_id;
第三步:打开浏览器开发者工具→Network标签页→筛选fetch请求→对比两个job_id对应请求的Request URL域名和路径。若域名相同但路径分别为/v1/t2v和/v1/i2v,说明后端服务相同,只是路由不同。
这一步做完就结束。


















