Agent Skills
每个 skill 对应一个原子创意能力。Agent 在功能体验中会根据对话自动选择和编排这些 skills。
视频内容理解
分析广告视频的商品/卖点/人群,并产出 OCR 文字轨道、人脸位置、开头/结尾密度,以及是否适合加 POV/CTA/Reply-to/字幕 的适配性判断(对齐 get_can_add_*,忽略语种限制)。
添加 POV
在广告视频前 3 秒叠加 POV(对齐 1200031):开头 OCR/人脸门禁 + LLM 不适场景过滤,再避让选位渲染。上半屏已有大字/已有 POV/OCR 过密等会跳过。
添加 CTA
在广告视频末尾约 3 秒添加 CTA(对齐 1200032):尾部 OCR/人脸门禁 + LLM 不适场景过滤,再避让选位渲染。尾部 OCR 过密、已有 CTA/品牌结束卡等会跳过。
添加 Reply-to 贴纸
在广告视频前 5 秒叠加 Reply-to 评论贴纸(对齐 1302007 / get_can_add_reply_to):dense OCR 三分屏门禁 + LLM 不适场景 + 人脸/OCR 避让选位后渲染。
添加卖点贴纸
在广告视频过程中叠加短卖点文字贴纸(对齐策略 1200034):自动生成购买驱动文案,OCR 语义去重,人脸与已有文字避让选位,字体颜色贴近商品主色且与背景保持对比。
添加字幕
根据口播 ASR 烧录字幕(对齐策略 1200033):检测已有烧录字幕覆盖、切分短句、人脸/OCR 避让选位后按时间轴叠加。无口播或已有字幕过多时会跳过。
加/换 BGM
给电商短视频添加或替换背景音乐(对齐 1306000/1306007/1306008):判断原声是否保留,优先素材库匹配,必要时用 Suno 生成纯音乐并混音。
视频混剪
对广告视频进行智能混剪:自动检测场景切点,理解每段内容,用 LLM 生成编排脚本;支持使用原始片段或 AI 生成新画面;自动配音、配 BGM、加字幕,形成一条完整的混剪广告视频。