
Pixelle-Video 使用指南从一句话主题到 AI 全自动短视频的完整实战手册【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video本指南以 Pixelle-Video 官方 README 为主线系统讲解这款 AI 全自动短视频引擎的核心能力、模块化生成流程、安装部署方式、配置项含义与 Web 界面三栏布局的完整操作步骤。读完本文你将掌握从「输入一个主题」到「自动产出带 AI 配图、语音解说与背景音乐的成片视频」的全链路实战方法并理解其背后基于 Streamlit 与流水线架构的实现原理。项目定位AI 全自动短视频引擎Pixelle-Video 的核心设计理念是零门槛、零剪辑经验——用户只需要输入一个主题引擎即可自动完成以下五步工作✍️ 撰写视频文案由 LLM 根据主题智能创作解说词 生成 AI 配图/视频为每句解说生成对应的 AI 插图或调用视频模型生成动态画面️ 合成语音解说通过 TTS 将文案转为旁白音频 添加背景音乐支持内置或自定义 BGM 一键合成视频逐帧渲染后拼接输出最终成片。从仓库源码结构看这一整套能力被封装在服务层 pixelle_video/service.py 的PixelleVideoCore中它统一暴露llm文案、tts语音、media/api_media图像与视频、video合成、frame_processor逐帧渲染等能力并注册了standard、custom、asset_based三条视频生成流水线见 pixelle_video/service.py。Web 界面与核心服务分层解耦前者负责交互后者负责生成。功能亮点一览全自动生成输入主题即自动产出完整视频AI 智能文案无需自己写脚本LLM 根据主题创作解说词AI 生成配图每个分镜都配有精美 AI 插图AI 生成视频支持 WAN 2.1 等 AI 视频生成模型创建动态内容直连模型 API可直接调用 DashScope、OpenAI、Seedream、Seedance、Kling 等图像/视频生成服务AI 生成语音支持 Edge-TTS、Index-TTS 等主流 TTS 方案背景音乐支持添加 BGM 增强氛围视觉风格多种 HTML 模板可选打造独特视频风格灵活尺寸支持竖屏1080x1920、横屏1920x1080、方形1080x1080等多种画幅多种 AI 模型支持 GPT、通义千问、DeepSeek、Ollama 等 LLM原子能力灵活组合既支持 ComfyUI / RunningHub 工作流也支持直连 API 模型可随时替换图像、视频、TTS、VLM 等能力。视频生成流程模块化的四段式流水线README 将 Pixelle-Video 的生成流程概括为四步文案生成 → 配图规划 → 逐帧处理 → 视频合成每个环节都支持灵活定制文案可选择不同 LLM、配图可选择不同图像工作流与风格、语音可选择不同 TTS 引擎、画面可选择不同模板与尺寸。源码视角标准流水线的八个阶段以默认的standard流水线pixelle_video/pipelines/standard.py为例底层实现远比四段式更细共拆分为八个阶段与 README 的宏观描述一一对应阶段对应方法作用1. 环境准备setup_environment创建独立任务目录与任务 ID确定最终视频输出路径2. 内容生成generate_content按generate/fixed两种模式生成或切分解说词3. 标题生成determine_title自动生成或使用用户指定的视频标题4. 视觉规划plan_visuals为每句解说生成图像提示词可叠加风格前缀5. 分镜初始化initialize_storyboard组装 Storyboard 与逐帧分镜数据6. 素材生产produce_assets逐帧生成音频、图像并渲染画面核心耗时环节7. 后期合成post_production拼接所有视频片段、叠加 BGM8. 结果收尾finalize生成结果对象并持久化任务元数据值得注意的两点实现细节模板类型感知在plan_visuals阶段引擎会根据所选模板的前缀static_/image_/video_判断是否需要生成媒体素材。静态模板static_*会完全跳过图像提示词与媒体生成从而节省 LLM 调用次数与生成成本见 pixelle_video/pipelines/standard.py。RunningHub 并行处理当使用runninghub/前缀的工作流时produce_assets会基于配置的并发上限runninghub_concurrent_limit用asyncio.Semaphore并行处理多个分镜显著缩短生成时间见 pixelle_video/pipelines/standard.py。快速开始两种安装方式方式一Windows 一键整合包推荐 Windows 用户整合包无需安装 Python、uv 或 ffmpeg解压即可使用从项目 Releases 页面下载最新的 Windows 一键整合包并解压双击运行start.bat启动 Web 界面浏览器自动打开 http://localhost:8501 在「⚙️ 系统配置」中配置 LLM API 和图像生成服务开始生成视频。整合包已内置全部依赖与启动脚本参见 packaging/windows/templates/start.bat首次使用只需配置 API 密钥。方式二从源码安装macOS / Linux / 需要自定义的用户前置环境依赖安装 Python 包管理器uv用于自动管理依赖与视频处理工具ffmpeg用于视频合成uv参照官方安装指南完成安装后运行uv --version验证ffmpegmacOSbrew install ffmpegUbuntu / Debiansudo apt update sudo apt install ffmpegWindows下载后解压将bin目录加入系统 PATH 环境变量安装完成后运行ffmpeg -version验证。三步启动# 第一步下载项目 git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video.git cd Pixelle-Video # 第二步启动 Web 界面uv 会自动安装依赖 uv run streamlit run web/app.py浏览器会自动打开 http://localhost:8501。Web 入口定义在 web/app.py采用 Streamlit 多页面导航结构包含「Home」主页与「History」历史记录页。第三步在 Web 界面完成首次配置展开「⚙️ 系统配置」面板填写LLM 配置选择 AI 模型通义千问、GPT 等并填入 API KeyComfyUI / RunningHub 配置如需用工作流生成图片、视频或语音配置本地 ComfyUI 地址或 RunningHub API KeyAPI 媒体模型配置如需直连图像/视频模型配置 DashScope、OpenAI、ARK、Kling 等供应商的 API Key、Base URL 与代理选项。配置完成后点击「保存配置」即可开始生成视频。配置文件 config.yaml 深度解析除 Web 界面外Pixelle-Video 也支持通过 YAML 文件集中管理配置。仓库提供了一份完整的示例 config.example.yaml复制为config.yaml即可使用注意切勿将含密钥的config.yaml提交到 Git。LLM 配置llm: api_key: base_url: model: 配置项说明api_key模型服务密钥base_urlAPI 地址兼容任何 OpenAI SDK 协议的服务model模型名称。Web 界面中的「快速选择预设」正是读取自 pixelle_video/llm_presets.py 中内置的预设表选择后自动填充base_url与model预设名称base_url默认 modelQwenhttps://dashscope.aliyuncs.com/compatible-mode/v1qwen-maxOpenAIhttps://api.openai.com/v1gpt-4oClaudehttps://api.anthropic.com/v1/claude-sonnet-4-5DeepSeekhttps://api.deepseek.comdeepseek-chatOllama本地http://localhost:11434/v1llama3.2Moonshothttps://api.moonshot.cn/v1moonshot-v1-8kOllama 预设的default_api_key为ollamaOpenAI SDK 要求必填但 Ollama 会忽略。所有预设均遵循 OpenAI SDK 协议理论上任何兼容该协议的私有部署模型都可手动填入。直连 API 供应商配置api_providers: common: print_model_input: false # 调试用打印发送给模型的 prompt、模型名与输入文件路径 local_proxy: # 本地代理如 http://127.0.0.1:9090 openai: api_key: base_url: https://api.openai.com/v1 use_proxy: false dashscope: api_key: base_url: https://dashscope.aliyuncs.com/api/v1 use_proxy: false ark: api_key: base_url: https://ark.cn-beijing.volces.com/api/v3 use_proxy: false kling: base_url: https://api-beijing.klingai.com access_key: secret_key: use_proxy: falsecommon段的local_proxy与use_proxy组合决定了各供应商请求是否走本地代理print_model_input用于在终端打印请求参数便于调试。底层读取逻辑见 pixelle_video/services/api_services/config.py它优先从配置管理器取值其次回退到同名环境变量。ComfyUI / RunningHub 配置comfyui: comfyui_url: http://127.0.0.1:8188 # 本地 ComfyUI 地址selfhost 工作流必需 comfyui_api_key: # ComfyUI API Key可选 runninghub_api_key: # RunningHub 云端密钥runninghub 工作流必需 runninghub_concurrent_limit: 1 # RunningHub 并发上限1-10普通会员默认 1 tts: default_workflow: selfhost/tts_edge.json image: default_workflow: runninghub/image_flux.json prompt_prefix: Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style video: default_workflow: runninghub/video_wan2.1_fusionx.json prompt_prefix: Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style要点Docker 环境下使用 ComfyUI 时macOS/Windows 填host.docker.internal:8188Linux 填宿主机 IPimage.default_workflow与video.default_workflow为必填项且无回退选项包括runninghub/*无需本地环境推荐与selfhost/*需本地 ComfyUIprompt_prefix控制整体画面风格语言需为英文在 pixelle_video/pipelines/standard.py 中与 LLM 生成的图像提示词拼接runninghub_concurrent_limit支持热更新无需重启即可生效。模板默认配置template: default_template: 1080x1920/image_default.html该配置决定了未显式指定时的默认画面模板同时隐含视频画幅比例。模板命名约定与仓库templates/目录结构一致static_*.html静态模板无需 AI 生成媒体纯文字样式image_*.html图片模板以 AI 生成图片为背景video_*.html视频模板以 AI 生成视频为背景。可选画幅1080x1920竖屏、1080x1080方形、1920x1080横屏具体见 templates 目录。Web 界面使用指南三栏布局实战打开 Web 界面后是典型的三栏布局左侧内容输入、中间语音与视觉设置、右侧生成视频。主页渲染逻辑见 web/pages/1__Home.py不同类型的生成流水线标准生成、自定义素材、数字人、图生视频、动作迁移等以 Tab 形式切换每种流水线 UI 通过 web/pipelines/base.py 的注册机制挂载。⚙️ 系统配置首次必填1. LLM 配置用于生成视频文案的 AI快速选择预设下拉选择通义千问、GPT-4o、DeepSeek 等预设后自动填充base_url和model再填入 API Key手动配置直接填写 API Key、Base URL、Model 三项。2. ComfyUI / RunningHub 配置用于通过工作流生成配图、视频片段或语音本地部署推荐填写 ComfyUI URL默认http://127.0.0.1:8188点击「测试连接」验证服务可用云端部署填写 RunningHub API Key。3. API 媒体模型配置用于不依赖 ComfyUI/RunningHub 时直连模型供应商的图像、视频或素材分析能力。支持的供应商包括OpenAI / GPT ImageGPT 图像生成模型DashScope / Wan / HappyHorse通义万象图像与视频生成Volcengine ARK / Seedream / Seedance字节 Seedream 图像与 Seedance 视频生成Kling AI / 可灵可灵视频生成。可配置项包括API Key / Access Key / Secret Key鉴权信息、Base URLWebUI 提供官方默认地址、本地代理如http://127.0.0.1:9090、启用代理每个供应商独立开关、打印模型请求参数调试用。 若只使用 ComfyUI 或 RunningHub可不填此项若选择api/...工作流则必须配置对应供应商的密钥。这些供应商与模型在源码中登记于 pixelle_video/services/api_media.py图像侧包括 dashscopewan2.7-image 系列、openaigpt-image-2、seedreamdoubao-seedream 系列视频侧包括 dashscopewan2.7-t2v、happyhorse 系列等、klingkling-v3 等、seedancedoubao-seedance 系列。每款视频模型的能力元数据时长范围、分辨率、画幅比例、原生音频、水印等登记在VIDEO_MODEL_CAPABILITIES中WebUI 会据此动态展示可用参数。 内容输入左侧栏生成模式AI 生成内容输入主题AI 自动创作文案。适合想快速出片、让 AI 写稿的场景例如「为什么要养成阅读习惯」固定文案内容直接输入完整文案跳过 AI 创作。适合已有现成稿件的场景支持段落/行/句子多种分割方式。背景音乐BGM无 BGM纯人声解说内置音乐选择预置背景音乐如 default.mp3自定义音乐将 MP3/WAV 等音乐文件放入仓库根目录的 bgm 文件夹即可在列表中选用可点击「试听 BGM」预览效果。 语音设置中间栏TTS 工作流从下拉菜单选择 TTS 工作流支持 Edge-TTS、Index-TTS 等系统会自动扫描 workflows 文件夹中的 TTS 工作流仓库内置tts_edge.json、tts_index2.json、tts_spark.json等熟悉 ComfyUI 的用户也可自定义 TTS 工作流放入该目录。参考音频可选上传参考音频文件用于声音克隆支持 MP3/WAV/FLAC 等格式适用于支持声音克隆的 TTS 工作流如 Index-TTS上传后可直接试听。预览功能输入测试文本后点击「预览语音」即可试听效果同样支持携带参考音频预览。 视觉设置中间栏图像生成决定 AI 生成配图的风格ComfyUI 工作流下拉选择图像生成工作流支持本地selfhost与云端RunningHub两类也支持api/...直连图像模型需先在系统配置中填写对应供应商密钥默认使用image_flux.json自定义工作流可放入 workflows 文件夹图像尺寸设置生成图像的宽高像素默认 1024x1024注意不同模型对尺寸有限制提示词前缀Prompt Prefix控制整体风格需为英文例如Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style可点击「预览风格」测试效果。视频模板决定视频画面的布局与设计从下拉菜单按尺寸分组选择模板竖屏 / 横屏 / 方形命名规范static_*.html静态、image_*.html图片、video_*.html视频点击「预览模板」可自定义参数测试效果懂 HTML 的用户可在 templates 文件夹创建自己的模板。API 视频生成当选择动态视频模板或扩展工作流时可直连 API 视频模型生成片段支持 DashScope Wan / HappyHorse、Kling、Seedance 等视频模型按模型能力动态展示分辨率、画幅比例、时长、水印、原生音频等参数支持网络/下载重试以及内容审核失败后自动用 LLM 将提示词「中性化改写」后重试实现在 pixelle_video/services/api_media.py重试机制检测datainspectionfailed、inappropriate content等审核错误标记在「自定义素材」工作流中API 视频片段会尽量匹配旁白音频时长并利用相邻片段信息提升画面连贯性。 生成视频右侧栏配置完成后点击「 生成视频」界面实时显示进度生成文案 → 生成配图 → 合成语音 → 合成视频例如「分镜 3/5 - 生成插图」生成完成后自动播放预览并显示视频时长、文件大小、分镜数等信息视频文件保存在 output 文件夹任务元数据与分镜信息由 pixelle_video/services/persistence.py 持久化可在「History」历史记录页回顾与复用。常见问题 FAQQ: 第一次生成一个视频需要多久A: 取决于视频分镜数量、网络状况与 AI 推理速度通常几分钟内即可完成。Q: 视频效果不满意怎么办A: 可以从四个维度迭代更换 LLM 模型不同模型文案风格不同调整图像尺寸与提示词前缀改变配图风格更换 TTS 工作流或上传参考音频改变语音效果尝试不同的视频模板与画面尺寸。Q: 费用大概多少A: 项目完全支持免费运行常见方案组合完全免费方案LLM 使用本地 Ollama ComfyUI 本地部署 0 元适合本地有显卡的用户推荐方案LLM 使用通义千问成本极低、性价比高 ComfyUI 本地部署云端方案LLM 使用 OpenAI 图像使用 RunningHub费用较高但无需本地环境。延伸阅读完整在线文档见仓库 docs/zh 与 docs/en涵盖快速开始、用户指南、参考手册与常见问题模板效果预览图位于 docs/images含 1080x1080、1080x1920、1920x1080 三档画幅内置工作流定义见 workflows/runninghub 与 workflows/selfhost服务层统一入口见 pixelle_video/service.py默认流水线实现见 pixelle_video/pipelines/standard.py项目采用 Apache 2.0 许可证详见 LICENSE。【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考