HUMAN × AGENT · INTENT ALIGNMENT

让表达更简单让意图被理解

人自然说出想法 · Agent 准确理解意图

AI AGENT PRODUCT PORTFOLIO

人自然表达
Agent 理解意图

我做过通用 Agent、视频创作垂类 Agent,也做过电商购物场景的 AI 能力。三段经历都在解决人和 Agent 之间的意图对齐:让人自然表达,让 Agent 获得结构化上下文并准确行动。

01 / EXPERIENCE

三段经历
三种意图对齐

三段经历都在解决同一件事:让人用符合真实场景的方式表达,让 Agent 获得足够准确、可执行的意图上下文。

02
INTENT ALIGNMENT 02花生 AI文稿 × 素材匹配

用户上传视频文稿,Agent 将每句话拆成分镜,在个人素材、本地上传与云端素材之间匹配画面,并允许用户用 Query 持续换片与修正表达

bilibili · 创作产品部 · 花生 AI2025.11 — 2026.04

AI 产品经理 · 视频创作 Agent

把固定 Workflow 升级为可协商的视频创作 Agent:让文字创作者围绕文稿、分镜和素材持续表达个性化意图,同时通过素材检索、语音优化与效果后台持续提升成片质量。

创作侧 · 文稿成片体验能力侧 · 素材检索与语音效果
  • 视频创作 Agent 化用 LUI 承接个性化意图,用 GUI 承接选片、换片等高频操作;Agent 将文稿按句拆成分镜,以文案语义为主、用户 Query 为执行参考,按意图模糊度与影响范围决定修改路径。
  • 端云融合素材检索对个人素材库与本地上传视频的画面、语义、人物和情绪做结构化理解,通过多路召回与排序匹配最合适片段,缺失分镜再由云端素材库补齐,兼顾个性化、时效性与版权约束。
  • 画面一致性提升围绕文稿、分镜、已确认素材和用户修改偏好管理项目 Memory,减少多轮换片后的意图丢失;同时引入分幕策略,幕内通过 SigLIP 加权与 VLM 精排,从逐句局部最优推进到整片全局一致,画面 GSB 由 30 提升至 75。
  • 语音效果优化基于 12,000+ bad case 搭建纠错后台,以“规则预处理 + LLM 动态 RAG 专名库 + 反馈闭环”持续治理 TTS,历史错误收敛 70%;同步推进音色克隆注册与配音能力,让个性化声音自然融入成片。
Agent 化素材检索分幕一致性TTS 优化音色克隆Memory 管理
花生 AI 文稿创作首页文稿创作入口 花生 AI 的文稿分镜、视频预览、素材候选与对话编辑工作区素材匹配编辑器 PRODUCT WORKFLOW · HUASHENG AI从输入文稿到素材匹配与自动成片打开官网
用户USER
INTERACTION STRATEGY低负担表达

用户直接说想法,界面自动绑定指代对象与范围

一句话停帧圈画多人批注
意图对齐INTENT ALIGNMENT
AGENT INPUT SCHEMA结构化意图修改对象修改范围修改颗粒度保留边界
智能体AGENT

02 HOW I BUILD AI PRODUCTS

把复杂的模型能力
变成自然的人机协作

这里展示三种会反复出现在我工作中的产品特质,以及它们如何落进真实交互。

01HUMAN EXPRESSION

让人自然表达

用停帧、圈画、时间戳与自然语言自动绑定指代关系,让用户直接说想法,无需反复澄清对象和范围。

02AGENT UNDERSTANDING

让 Agent 结构化理解

把自然表达转译为修改对象、修改范围、修改颗粒度与保留边界,让 Agent 准确理解哪里要改、影响多大、什么不能变。

03RELIABLE EXECUTION

让意图稳定变成行动

结合多模态理解、Context Engineering 与 Agent Harness,用可体验原型验证技术路径,让理解稳定转化为可执行结果。

AIGC POST-GENERATION REVIEW

AIGC 成片生成后的多轮审片与返修

场景发生在 AIGC 已经生成多镜头成片之后创意团队围绕画面持续审片、协商与返修让 Agent 始终理解哪里要改、怎么改、什么不能变

POST-GENERATION · MULTI-TURN REVISION

生成第一版只是开始多轮改片才是难点

AIGC 可以快速给出第一版成片,但真实创作不会一次结束。用户会在观看中不断发现问题、补充偏好、回应他人意见,并基于上一轮结果继续返修。难点是让每一轮反馈都与正确镜头、时间点、画面证据和历史决策保持连接。

01 · THE POST-GENERATION GAP

对话框承接不了 AIGC 成片后的多轮协商

修改意见发生在具体画面与上一轮结果中,脱离视频的对话会让反馈与生成上下文、历史决策逐轮分离。

  1. 01
    输入框打断审片流程

    用户需要暂停视频、跳到输入框描述问题,再回到画面确认;注意力在“看”和“写”之间反复切换,连续的审片判断被拆散。

  2. 02
    引用颗粒度与问题颗粒度错位

    生成视频通常以分镜为最大引用单位,但真实修改往往发生在某一秒、某一帧或某个对象上。镜头、时间戳和对象都要由用户重复说明。

  3. 03
    对话流难以承载多人协作

    创意、品牌、后期与投放意见散落在不同轮对话里;进入下一轮生成后,哪些已确认、哪些待修改、哪些存在冲突都难以继承。

02 · PRODUCT SOLUTION

让人围绕成片协商,让 Agent 继承每轮修改

把评论、时间戳、圈画和协作者放回 AIGC 成片现场。系统将每条自然表达绑定到生成版本、镜头 Prompt、画面证据与修改边界,形成下一轮返修可以继续使用的结构化状态。

  1. 01
    边看边评

    意见钉在播放时刻,观看与表达保持在同一条流程里。

  2. 02
    自动定位

    同步记录分镜 ID、全片时间、镜头内时间、当前帧与圈画对象。

  3. 03
    多轮继承

    同一镜头的多人意见先被合并,Agent 记录已确认项、修改项与保持项,并带入下一轮生成。

HUMAN VIEW

人看到什么

SHOT_03 · 00:02.4

李浩源 · 创意总监持罐角度再自然一点,保留现在的真实情绪。

用户围绕 AIGC 成片直接指出问题、补充期望,并与团队协商下一版要改什么。

AGENT PAYLOAD

Agent 得到什么

version / shot
V3 · SHOT_03
global / local time
00:02.4 · 00:00.27
visual evidence
当前帧 + 圈画合成图
source context
镜头 Prompt · 素材 · 角色意见
change / preserve
调整持罐角度 / 保留真实情绪
plan output
意见合并 · 修改边界 · 下一轮返修计划

结构化数据包让 Agent 继承当前版本、镜头 Prompt、多人意见与历史修改边界,先形成方案,再进入下一轮局部生成。

  1. 01观看生成版在成片中发现问题
  2. 02自然表达评论 · 时间戳 · 圈画
  3. 03协商并合并多人意见 · 修改边界
  4. 04进入下一轮Agent 局部返修
FEATURE WALKTHROUGH

观看一轮 AIGC 成片后的协商与返修

从观看生成版、停帧圈画、多人意见合并,到 Agent 形成下一轮修改方案。

AIGC BEVERAGE AD · REVISION ROUND

LUMO 青柠气泡饮

一支由 AIGC 生成的四镜头广告初版:冰桶钩子 → 开罐微距 → 真人饮用 → 产品收尾。接下来演示团队如何围绕成片协商,并把意见交给 Agent 进入下一轮返修。

  1. 观看 AIGC 生成初版
  2. 停帧圈画并协商意见
  3. Agent 合并后进入返修
PRODUCT PRINCIPLE

好的 Agent 交互,把简单留给人,把复杂留给 Agent人只需自然表达意图,Agent 架构与 Harness 负责理解意图、补全信息、规划任务、调用工具,并对执行结果进行校验