Skip to content

生产线核心流水线 (Workflow)

MagicCore 视频工厂采用**“端云协同(Client-Cloud Hybrid Architecture)”**的生产线设计架构。本章节为您揭秘一段原片如何通过五道工序蜕变为高品质解说成片。


生产线核心五步法架构

┌──────────────┐     ┌──────────────┐     ┌──────────────┐
│  第一步:导入 │ ──> │  第二步:分析 │ ──> │  第三步:导演 │
│ 本地长片素材 │     │ 场景切片抽帧 │     │ 云端大模型决策 │
└──────────────┘     └──────────────┘     └──────────────┘


┌──────────────┐     ┌──────────────┐     ┌──────────────┐
│  第五步:交付 │ <── │  第四步:对齐 │ <── │  声音工程与  │
│ 终检导出成品 │     │ 物理音画锁合 │     │ TTS 旁白渲染 │
└──────────────┘     └──────────────┘     └──────────────┘

第一工序:原素材导入与预处理(本地)

  1. 用户选定本地视频素材文件(支持 MP4、MKV、MOV 等格式,支持电影、剧集、长纪录片);
  2. 客户端本地读取视频元数据:分辨率、色彩空间、帧率(FPS)、总时长;
  3. 用户在 UI 上选择解说风格、目标成片时长(如 10 分钟)、配音音色与字幕模板

第二工序:智能场景分割与关键帧特征提取(本地)

  1. 本地算法根据画面光学变化、镜头切换点(Shot Transition)执行自动切片分割;
  2. 为每一个独立镜头片段打上唯一身份标识(UUID)与起止时间码;
  3. 提取镜头关键帧的视觉降维特征,准备传输至云端导演模型。

第三工序:云端导演大脑决策(Cloud LLM Director)

这是视频工厂区别于市面所有流水线软件的核心所在:

  1. 看全片而非盲写:云端导演大模型读取整个素材的时序片段特征与情节脉络;
  2. 严格 Schema 选镜:根据用户设定的目标时长和叙事节奏,大模型只能通过片段的 UUID 引用镜头,杜绝臆想;
  3. 分段解说文案撰写与润色:针对选定的镜头组合,撰写具有强引导力、强网感的旁白文案。文案经历云端最多 3 轮语义与长度合规审查,保证叙事张力。

第四工序:声音工程与物理音画强对齐(本地 + 云端)

  1. TTS 语音生成:将通过审核的旁白文案发送至高品质自然语音引擎(音色严格绑定特定语言与物理语速),生成高保真音频波形文件;
  2. 物理时长锁合(Audio-to-Video Lock)
    • 提取生成的旁白音频真实物理时长(以毫秒为单位)
    • 画面剪辑严格根据真实音频时长动态微调镜头速率或切换,杜绝大模型口头预估导致的音画脱节;
    • 允许 1 帧内的物理渲染误差兜底,确保每一声解说精准落在对应的画面高光瞬间;
  3. 智能原声音画混音 (Audio Ducking)
    • 保留原素材中震撼人心的环境原声(如爆炸、对话、掌声,默认保留 20%);
    • 当解说旁白发声时,原声音量自动下潜至背景音(Ducking);
    • 旁白间歇期,原声自然淡入,避免生硬割裂。

第五工序:花字字幕律动与本地高速渲染导出(本地)

  1. 根据旁白音频的真实发音气口(Phoneme Timestamps),逐字生成高精度动态花字字幕;
  2. 混入响度归一化处理后的环境配乐(BGM);
  3. 利用用户本机的显卡硬件(NVIDIA NVENC / AMD / Intel QuickSync)进行高速本地硬件编码渲染;
  4. 渲染完成后执行自动完整性校验,确认画面流畅、声画同步,交付最终成片。

MagicCore Unified AI Infrastructure