Lightricks 推出的新一代开源音视频生成模型 LTX 2.3 正式亮相。它不仅在画质、运动表现和提示词理解上大幅提升,更实现了在本地同时生成视频+同步音频的强大能力。
本篇保姆级教程将带你从零开始,完整走一遍 LTX 2.3 的 ComfyUI 安装、显存优化适配、越狱模型与工作流配置,助你用消费级显卡(最低 8G 显存)轻松玩转开源 AI 电影大片生成。
一、 准备工作:ComfyUI 环境搭建
为了完美支持 LTX 2.3 的新特性与越狱模型,建议使用最新版的 ComfyUI 客户端。[点击官方下载]
下载或更新 ComfyUI:
前往官方或指定网盘下载并覆盖安装最新版 ComfyUI 客户端。
安装核心扩展节点:
如果你计划使用 8G 显存版(GGUF 格式) 模型,务必在 ComfyUI 的管理器(Manager)中搜索并安装
ComfyUI-GGUF节点包,否则无法识别 GGUF 模型。
二、 模型文件下载与目录规范
LTX 2.3 涉及的模型文件较多,【点击下载】请严格按照以下路径在本地 ComfyUI 目录(通常位于 C:\Users\你的用户名\AppData\Local\Comfy-Desktop\ComfyUI-Shared\models\)中归类放置:
1. 对应文件夹结构与下载指引
三、 工作流加载与 8G 显存优化配置
导入工作流:
下载对应的 LTX 2.3 越狱工作流 JSON 文件【点击下载】,直接拖入 ComfyUI 空白画布中。若提示缺少节点,点击详细情况中的下载按钮自动补全。
8G 显存版 (GGUF) 节点调整:
在画布空白处双击,搜索并添加
Unet Loader (GGUF)节点。删除原有的 Checkpoint 加载器,将新节点的
MODEL输出连接到原本的紫色线上。在 Unet 节点中选中
PinkCherry_FineTune_Q5_K_M_v18_LTX23.gguf模型。
四、 高效提示词参考(支持音视频同步)
LTX 2.3 能够同时理解画面运动与声音生成。以下为您提供两个实测效果极佳的提示词模板:
1. 中国古风动态(文生视频/图生视频)
提示词内容:
中国古风电影感短剧,保持参考图片中人物的脸部特征、发型、妆容、淡蓝色汉服、蓝色发簪、耳饰和整体视觉风格完全一致。0-3秒:近距离特写,女子安静地看向镜头,微微眨眼,嘴角带着非常自然温柔的笑意。几缕黑色发丝被微风轻轻吹动,蓝色流苏耳饰和发簪上的珠饰轻微摇晃,眼神温柔灵动。镜头非常缓慢地向前推进,浅景深,电影级柔和光线。3-7秒:女子缓缓转过脸,轻轻回眸看向镜头,动作优雅自然。她的手指轻轻整理耳边的一缕发丝,衣袖随着动作产生细微自然的布料运动。背景逐渐显现出古色古香的江南庭院,白墙黛瓦、木质窗棂、远处有竹林和淡淡的薄雾,空气中飘落几片浅色花瓣。7-11秒:镜头缓慢环绕人物,从侧前方移动到正面。女子微微低头,然后再次抬眼看向镜头,露出温柔而含蓄的笑容。耳环、发簪、发丝随着动作自然摆动,汉服衣襟和衣袖有轻微真实的动态。阳光穿过竹叶形成柔和的光影变化。11-15秒:女子靠近镜头一点,保持自然微笑,用非常轻柔、温婉的中文低声说道:“公子,今日的风,很温柔。”说完轻轻一笑,目光停留在镜头上。整体风格:唯美中国风、古典东方美学、江南水乡...(包含自然中文女声对白、古筝音乐、微风声及竹叶沙沙声)。
2. AI 电影短剧(带台词与音效同步)
Prompt (英文控制更精准):
Cinematic realistic image-to-video scene, 10 seconds. Keep the woman's face, hairstyle, clothing, body proportions and the original room completely consistent with the reference image. She is sitting indoors, speaking naturally to someone off camera.
0-3 seconds: She continues speaking softly, looking slightly toward the right side of the frame. Her lips move naturally and accurately synchronized with the Chinese dialogue: “你终于来了,我等你很久了。”
3-6 seconds: She suddenly notices something unusual behind the camera, expression becomes confused and cautious.
6-8 seconds: She slowly turns her head toward the camera and looks directly into the lens, expression nervous and serious.
8-10 seconds: She quietly whispers in Mandarin Chinese: “但是……你身后有人。”
Audio: Natural Mandarin Chinese female dialogue, accurate lip synchronization, subtle breathing, quiet indoor room ambience. No music.
Camera: Slow cinematic push-in toward her face, shallow depth of field, realistic focus, natural lighting, photorealistic cinematic quality.
五、 常见问题排查 (FAQ)
Q:加载 GGUF 模型时报错说找不到节点?
A:请确保已在 ComfyUI Manager 中安装了
ComfyUI-GGUF插件并重启了软件。
Q:生成视频时没有声音或音画不同步?
A:检查 VAE 节点的连线是否正确,确保音频 VAE (
LTX23_audio_vae_bf16) 正确接入音频解码链路。
Q:8G 显存运行依然提示显存溢出 (OOM)?
A:尝试降低生成的分辨率和帧数,或者在 ComfyUI 启动脚本中加入
--lowvram或--medvram参数。
评论区