VideoAgents · AI Agent 视频生产团队

视频数码体:把小说变成分集长剧的 AI 智能体团队

83 个专业 Agent、13 个制作部门,从小说改编、资产设计、故事板、3D 白模预演、视频生成到后期成片全流程自动化,每一步都有人工确认闸门兜底;优化过的工作流把成片成本控制在每分钟 10 元以内。开源、本地运行,数据不上传。

Sound Familiar?

做 AI 中长剧,这些坑你可能已经踩过

传统视频团队从「一分钟 AI 短剧」转向「十分钟级 AI 中长剧」时,普遍会撞上同一批问题。

How VideoAgents Solves It

视频数码体是怎么应对这些问题的

以下每一条解法均可在产品代码仓库中找到对应的 Agent 职责定义,没有代码依据的能力一律不写。

01

道具 / 服装跨镜跳变 → 全片资产库 + 比例锚图 + 换装矩阵

传统实拍剧组有道具库、服装库来保证"这件东西全程长一个样";视频数码体把这套逻辑做成了文件化的资产系统:

  • 道具 Agent为每件剧情道具建卡,记录外形材质、易主链,并强制生成"比例锚图"(道具与参照物同框,标注相对尺度),供视频生成时锚定,避免道具凭空变大变小、变色变材质。
  • 服装 Agent为每个主要角色按「场合 × 时期」建服装矩阵,精确标注每个换装点发生在哪一个剧情事件之后,避免出现"该换的时候没换、不该换的时候换了"。
  • 服装概念 Agent为每套服装出一张与角色定妆图同源的参考图,让"这个人穿这套衣服"有图可依,而不是全靠文字描述硬猜。
02

多人镜头调度、空间关系复杂 → 3D 白模预演 + 导演台

横屏中长剧最考验的长镜头调度、多人同框、景别切换,靠文字说不清"谁站在哪"。视频数码体的做法和实拍剧组一样——先搭白模走一遍戏,再开机:

  • 3D 白模:每个场景按真实米制尺度搭出灰盒模型,每个生成组里的角色、群演、生物、道具和摄影机都有带关键帧的精确调度——走位、六种姿态(站/坐/躺/跪/蹲/趴)、头身朝向、手部动作、镜头焦段与运动轨迹。俯视、环绕、机位等四个视口加时间轴,可以逐帧审看。
  • 白模即参考视频:用户签字确认后,系统按机位视角导出每组的白模视频,自动作为参考视频挂进该组的生成指令,并附"哪个颜色的人形对应哪个角色"的图例(每个角色、生物整集固定一个专属色)——模型拿到的是看得见的站位、景别、纵深和运镜,而不是一段含糊的空间描述。
  • 待决项裁决:调度 Agent 遇到拿不准的取舍(朝向、遮挡、时机、出入场等)不会埋在文字里,而是列成结构化待决项,附备选方案、依据和"看现场"时间点,由你在 3D 视口里裁决;阻断级问题未清不能签字。
  • 导演台:一个全窗口工作台,点选任意时刻的任意角色、道具或机位写修改意见,整批派给调度 Agent 重排;也可以解锁后直接拖动人物、道具和摄影机,自动打关键帧,本地即时生效、不消耗 Agent 调用。每次修改自动存版本,可 A|B 对比;还有三分线与安全框、实时镜头参数、碰撞提示、180° 轴线越轴提示,以及"白模机位 / 故事板草图 / 背景图 / 已生成片段"四联监视器。
  • 连续性规划 Agent在镜头设计冻结前,专门检查相邻镜头/相邻生成组交界处的轴线、光线方向是否连续,把穿帮拦在生成之前。
03

戏剧语言难翻译成 AI 听得懂的指令 → Prompt 工程标准化

视频数码体设了专门的 Prompt Agent,把导演的分镜设计"翻译"成生成模型能精确执行的指令:

  • 每一镜按"运镜方式 + 主体动作与表情 + 空间位置 + 音频信息"四要素结构化写入,一镜只用一种运镜手法,避免相互矛盾的指令。
  • 动作描述要求具体到肢体部位并量化幅度与速度(比如"缓慢抬手"而不是笼统的"抬手"),情绪一律转成看得见的身体细节(悲伤→低头、肩膀微颤;紧张→呼吸急促、手指敲击),而不是留一句抽象的情绪词让模型自由发挥。
04

表演细节(如细微表情)难靠指令精确控制 → 表演证据层

针对台词场景与情绪高点场次,Prompt Agent 会把"这场戏该怎么演"拆解成可执行的表演节拍:说话前的状态、说到关键词时脸部哪个区域怎么动、呼吸停顿在哪、说完后停在什么状态——把导演的表演意图变成模型看得懂的具体证据,而不是一句"情绪要到位"。

05

人一多容易乱、角色形象跑偏 → 角色一致性校正 + 防重复约束

  • 角色一致性 Agent对每一张新生成的关键帧做人脸比对,相似度低于 0.85 自动重新生成(最多 3 次),不达标不放行。
  • Prompt 里会显式声明"画面里有且只有 N 个人、每个人都要匹配参考图、不允许多出或重复的人物",从源头上抑制"无中生多人"的问题。
06

不确定性是个无底洞、返工成本不可控 → 剧本预览 + 故事板 + 分阶段人工确认闸门

返工最贵的是"片子都生成完了才发现剧本或分镜不对"。视频数码体把审看尽量前移到不花生成费的环节:

  • 剧本预览:每集剧本与剧情层的分析结果合成一张双栏表——左边是按原顺序切块的剧本,右边是对应的时长估算(对白/旁白/静默三色条)、情绪强度、节奏、戏剧目的、钩子落点、可删减与不可压缩项,不用再翻 Markdown 和 JSON。每一行都能一键把修改意见派给对应的剧情 Agent;还可以划选文字标记"关键情节 / 关键细节",后续故事板和镜头表必须逐条给出落实依据,否则机检不通过。
  • 故事板:逐场逐镜的分镜表(景别、内容、动作、姿态、对白、旁白挂点、构图),可整集批量或单镜出铅笔草图,草图模型可单独选便宜的图像模型;也支持手机手绘草图,再由 AI 按项目风格加工。草图还能按计划时长串成带字幕和已有配音的动态样片,零生成费用,在花视频生成费之前先看节奏和镜头密度。
  • 11 个人工确认闸门:世界观、角色资产、美术风格、剧本、故事板、白模、每集分镜、每集生成画面、后期、首集成片、发布,签字后才进入下一阶段;上游产物在签字后又被改动,页面会标记"签字已过期"。问题在早期签字环节就被拦下重来,而不是等到成片阶段才推倒重做。
07

每分钟几百元的生成成本 → 优化过的工作流,每分钟控制在 10 元以内

行业里 AI 视频成片成本一般在每分钟几百元,大头是反复抽卡的废片。视频数码体的工作流从流程上把钱省下来,成片成本可以控制在每分钟 10 元以内:

  • 先用零成本手段把戏排好:动态样片、3D 白模、白模自检静帧、导演台拖拽调整全部本地渲染,不产生生成费用;该改的在这里改完,再去调用按秒计费的视频模型。
  • 花钱的步骤排在签字之后:比如分镜背景图只在白模签字后才生成;自动重跑次数默认为 0,失败先交给人判断,而不是默默再烧一轮。
  • 复用优先:角色三视图、场景图、道具比例锚图直接复用,概念库已完全覆盖的生成组不新出一张图;场景全景图按机位覆盖关系共享,而不是每个分镜位置各出一张。
  • 草稿档生成 + 超分交付:视频按草稿分辨率生成,过审后超分到交付分辨率,不按成片档重新生成;派单路径上有分辨率硬闸,防止 Agent 工单误跑高分辨率。
  • 局部修复代替整组重抽:服装、道具等连续性瑕疵用针对性的局部修复工单处理,成本远低于整组重新生成。
  • 模型分级调度:语言模型按任务复杂度智能分配——创作核心 Agent 用高档模型,其余用低价模型;草图和各类预览图可单独指定便宜的图像模型。
08

成片有瑕疵只能整组重抽 → 后期处理工作台

画面过审之后、成片合成之前,视频数码体提供一个三栏的后期处理工作台,把调色、特效、修补这些"最后一公里"从重新抽卡变成可控的后期工序:

  • 处方式调整:细节填充、调色与光感、特效、包装、音效与声音五大类处方,作用范围分五级(整集 → 场 → 叙事段落 → 生成组 → 组内时间段),下级覆盖上级。基础校色、LUT 预设、去闪烁、去台标、叠加素材与水印等由本地 FFmpeg 直接出片,并有 4 秒快速预览;超分、局部重绘、补帧、重打光、生成式特效则派给后期 Agent。
  • 母本永不覆盖:每个生成组一条版本链,A|B 分屏、划像、闪切对比,随时回滚。
  • 分镜剪辑:删除时间段、用同组另一版本替换某一段、在播放头或组交界处插黑/定格,还能导入外部版本做片段拼接。
  • 回忆、梦境、蒙太奇自动调色:调色规划 Agent 把色彩脚本里的意图自动转成段落级处方并出片,是否采纳由你决定。
  • 整集时间轴:画面/包装/声音三条图层轨加对白、旁白、BGM、音效四条音轨,支持导出 CSV/EDL 到剪辑软件;拼装预检通过并签字后一键总装,插入或删除的时长会自动带动音频与字幕平移。
09

人脸版权风险、"平均脸"审美疲劳 → 原创角色设计,不基于真人换脸

视频数码体的角色形象是角色概念 Agent根据角色设定文字(性别、发色、瞳色、体型、标志物等)与美术风格生成的原创人设图,不是拿真人照片做换脸或融脸处理——从源头上避免了肖像权风险,角色长相由设定驱动而非"抓一张网图糊上去"。

10

审查环境严格,细节把关 → 内容安全终审 + 版权终审

  • 内容安全 Agent在每集终审阶段逐镜扫描暴力、裸露、危险行为等各平台红线,并给出分级建议,封面、字幕、片头片尾一并审查。
  • 版权 Agent核验每一项素材(BGM、字体、参考图等)的授权来源、许可类型与授权范围,拿不出授权记录的素材不允许上片。
11

AI 配音目前只适合"修补" → 默认画面原生对白,后期配音仅作补录

视频数码体默认让视频生成模型直接原生合成画面里的对白语音与口型(不是拿 TTS 音轨去"配"上去);只有在项目设置里显式开启"后期配音"时,才会走单独的补录流程去修补个别镜头的台词音轨——这与传统团队"AI 配音暂时只适合修补"的经验判断是一致的,视频数码体没有夸大 AI 配音能整部剧全包办。

12

创作记录难留痕 → 全程文件化产物 + 项目内版本管理

每一步产出(设定卡、参考图、分镜、生成参数)都落成文件,项目本身有内置的版本管理(基于 Git 技术),每次生成的模型/渠道/参考图都会记入元数据,方便追溯"这一版是怎么来的"。

Core Features

一套系统,覆盖从小说到成片的全流程

剧情与世界观改编

把长篇小说的情节、世界观、时间线拆解成结构化数据,作为后续所有创作环节的事实依据。

角色与资产设计

角色外观、性格、关系、声音、服装、道具、场景、生物——每一类都建卡立库,并生成对应的参考图/声音样本,作为全片生成时的"唯一形象锚点"。

导演分镜与运镜

自动完成分镜脚本、机位、构图、走位、连续性核查,把导演意图转化为结构化的镜头设计文件。

剧本预览与故事板

剧本与时长、情绪、节奏、钩子分析并排成表,逐行可派修改意见;故事板逐场逐镜列出分镜,可出铅笔草图、手绘加工,并串成零生成费用的动态样片。

3D 白模与导演台

按米制尺度搭场景白模,对人物、道具、摄影机做关键帧调度;在导演台里点选批注或直接拖拽修改、A|B 对比版本,签字后的白模视频自动成为视频生成的空间参考。

视觉与音频生成

对接图像、视频、音乐、TTS 等多种可配置的生成服务,按分镜设计和资产锚点批量生成画面与声音,并做一致性校正。

剪辑与合成

把生成的镜头素材按分镜顺序合成、加字幕花字、配乐混音,产出可发布的成片。

后期处理工作台

调色、光感、特效、细节修补、包装、音效统一用"处方"管理,五级作用范围;母本不覆盖、版本可对比回滚,支持分镜剪辑、插黑定格与时间轴导出。

低成本工作流

零成本预演先行、付费步骤签字后才执行、资产复用优先、草稿档生成加超分交付、模型分级调度——成片成本控制在每分钟 10 元以内。

质量审核(8 个 QA 并行)

逻辑、角色一致性、时间线、世界观一致性、视觉质量、音频质量、内容安全、版权 8 个维度并行审核,8 份报告全绿才能签发发布。

人工确认闸门

世界圣经、角色资产、美术风格、剧本、故事板、白模、每集分镜、每集视觉生成、后期、首集成片、发布——11 个节点由真人签字确认,创作方向始终在人的掌控之中。

多引擎、多模型可配置

执行引擎支持 Claude CLI、Codex CLI 和 OpenAI 兼容的 DeepAgents;图像、视频、音乐、TTS、对象存储等生成服务均可在控制台单独配置,不锁定在某一个模型或渠道上,模型更新了也不用推倒重来。

本地运行,数据不上传

项目素材(小说原文、配置、生成媒体)默认保存在本地 data/projects/,不会提交到 Git;控制台默认只监听本机地址。

开源可自托管

以 Apache License 2.0 协议开源,允许使用、修改、分发和商业使用。

Get Started

三步开始你的第一部 AI 长剧

  1. 下载并安装客户端(见下方「下载」区);安装包不含 Python 运行时,首次启动如本机没有可用环境会自动下载配置,无需手动安装 Python。
  2. 配置执行引擎与生成服务:首次打开时选择或创建项目,配置至少一种执行引擎(Claude CLI / Codex CLI / DeepAgents 三选一)以及实际要用到的图像/视频/音乐/TTS 等生成服务凭据。
  3. 导入小说,跟随人工确认闸门推进:新建项目并导入小说文本后,系统会依次产出世界观、角色资产、美术风格、剧本、故事板、白模、分镜、画面与后期——每个关键节点都会停下来等你签字确认,确认无误再进入下一步,直到成片与发布。

面向开发者的补充路径(源码运行,来自 README 快速开始):

git clone https://github.com/AgenticsWorld/VideoAgents.git
cd VideoAgents
python3 -m venv .venv && source .venv/bin/activate
python -m pip install --upgrade pip && python -m pip install -e .
python apps/web/server.py

浏览器打开 http://127.0.0.1:8630 即可使用。

Download

下载视频数码体客户端

平台说明下载
macOS
下载后解压安装;安装包不含 Python 运行时,首次启动按需自动下载配置 下载 macOS 版
Windows
下载后解压安装;同上 下载 Windows 版

运行前还需要准备什么

FAQ

常见问题

使用视频数码体需要自己装 Python 环境吗?
不需要。发布的桌面客户端安装包不包含 Python,首次启动时如果本机没有可用环境,客户端会自动下载配置;只有做桌面开发或从源码打包时才需要自行准备 Python/Node 环境。
视频数码体支持哪些 AI 模型/生成引擎?
Agent 执行引擎支持 Claude CLI、Codex CLI 和 OpenAI 兼容的 DeepAgents,三选一或按需切换;图像、视频、音乐、TTS 与对象存储等生成服务均可在控制台单独配置对接的渠道,不绑定单一模型厂商。
我的小说原文和生成的视频素材会被上传到云端吗?
默认不会。项目素材(小说原文、项目配置、生成的图片/音视频)默认保存在本地 data/projects/ 目录,不会提交到 Git;本地控制台默认只监听 127.0.0.1。
视频数码体开源吗?可以商用吗?
是。项目以 Apache License 2.0 协议开源,允许使用、修改、分发和商业使用;再分发时需要保留许可证与版权声明。
生成的画面角色形象跑偏、道具变了样怎么办?
系统有自动校正机制——比如角色关键帧会自动做人脸相似度比对,低于阈值会自动重新生成(最多 3 次);更重要的是,资产库(角色三视图、服装矩阵、道具比例锚图)会作为每次生成的参照锚点,加上分阶段人工确认闸门,大部分形象问题能在早期签字环节被拦下,而不必等到成片才发现。
用视频数码体生成一分钟视频大概要花多少钱?
行业里 AI 视频的成片成本一般在每分钟几百元。视频数码体通过优化过的工作流——动态样片与 3D 白模等零成本预演先行、付费生成步骤排在人工签字之后、资产复用优先、草稿档生成加超分交付、局部修复代替整组重抽、模型分级调度——可以把成片成本控制在每分钟 10 元以内;实际花费取决于你选用的生成渠道与模型。