AI AGENT PRODUCT PORTFOLIO
人自然表达
Agent 理解意图
我做过通用 Agent、视频创作垂类 Agent,也做过电商购物场景的 AI 能力。三段经历都在解决人和 Agent 之间的意图对齐:让人自然表达,让 Agent 获得结构化上下文并准确行动。
三段经历
三种意图对齐
三段经历都在解决同一件事:让人用符合真实场景的方式表达,让 Agent 获得足够准确、可执行的意图上下文。
人在观看成片与上传参考素材时自然表达,Agent 通过结构化反馈协议与模态路由,把模糊意图还原为可执行的创作上下文
AI 产品经理 · 视频 Agent
围绕视频创作的“生成前理解”与“生成后反馈”,重点建设 Human-in-the-loop 审片和多模态内容理解,让 Agent 既能读懂参考素材,也能准确接住用户的修改意见。
- Human-in-the-loop 创新审片能力针对反馈需要在视频与输入框间反复跳转、定位粒度不足和多人意见难汇总的问题,设计 LUI + GUI 混合审片。把时间戳、分镜 ID、圈画截图与自然语言自动绑定,由 Agent 按镜头合并意见,用户确认后再执行;统筹修改效果提升 20%,无效积分消耗下降 35%,以第一贡献人申请发明专利。
- 多模态内容理解能力针对用户难以先把参考意图描述到足够细的问题,依据文件格式与后缀将输入路由至视频、音频、图片、文档和链接五类专用链路;每类配置特化 System Prompt,再结合用户 Query 做高精度参考分析,支持最多 50 个全模态素材,孵化视频拉片、AI MV 与音乐卡点剪辑等场景。
- 口播剪辑与动效包装能力推动 Hyperframe(HTML → MP4)能力产品化。Agent 结合 ASR 口播重点、画面配色与人物位置匹配设计库并规划花字动效,主动避让人脸等关键区域,同时保留围绕字体、布局、颜色和节奏继续协商修改的空间。
- Agent 架构优化以用户负面反馈作为 Trace 回溯锚点,定向检查意图理解、上下文与工具调用节点,持续优化 Harness、Skill、Tool Routing 和任务编排,减少错误路由、重复调用与规则漏执行。
创作入口
视频工程
审片协商
用户上传视频文稿,Agent 将每句话拆成分镜,在个人素材、本地上传与云端素材之间匹配画面,并允许用户用 Query 持续换片与修正表达
AI 产品经理 · 视频创作 Agent
把固定 Workflow 升级为可协商的视频创作 Agent:让文字创作者围绕文稿、分镜和素材持续表达个性化意图,同时通过素材检索、语音优化与效果后台持续提升成片质量。
- 视频创作 Agent 化用 LUI 承接个性化意图,用 GUI 承接选片、换片等高频操作;Agent 将文稿按句拆成分镜,以文案语义为主、用户 Query 为执行参考,按意图模糊度与影响范围决定修改路径。
- 端云融合素材检索对个人素材库与本地上传视频的画面、语义、人物和情绪做结构化理解,通过多路召回与排序匹配最合适片段,缺失分镜再由云端素材库补齐,兼顾个性化、时效性与版权约束。
- 画面一致性提升围绕文稿、分镜、已确认素材和用户修改偏好管理项目 Memory,减少多轮换片后的意图丢失;同时引入分幕策略,幕内通过 SigLIP 加权与 VLM 精排,从逐句局部最优推进到整片全局一致,画面 GSB 由 30 提升至 75。
- 语音效果优化基于 12,000+ bad case 搭建纠错后台,以“规则预处理 + LLM 动态 RAG 专名库 + 反馈闭环”持续治理 TTS,历史错误收敛 70%;同步推进音色克隆注册与配音能力,让个性化声音自然融入成片。
文稿创作入口
素材匹配编辑器
PRODUCT WORKFLOW · HUASHENG AI从输入文稿到素材匹配与自动成片打开官网
用户从 Google 带着关键词、地点与即时需求进入,Agent 让搜索词、页面语义和旅行商品形成更高相关的承接关系
AI 产品经理 · SEO 增长
围绕 Google 自然搜索流量,重构“搜索意图—页面语义—商品推荐—规模化投放”链路:C 端提高搜索承接与推荐相关性,B 端把策略配置和页面生产沉淀为运营平台。
- 搜索推荐优化结合搜索热词、地点、当前 Keywords 与页面爬取内容,用 Coze 搭建加权逻辑链 Agent,重写 Google 词条中的 Title、Keywords、Description 与核心卖点,提高页面语义和用户意图的匹配;推动列表页排名 43→15、详情页排名 16→9。
- 流量承接优化针对占收录页面 48% 的 404 页面,根据用户搜索词与 IP 归属国家判断需求,从商品库二次召回高相关、高价值供给并动态排序,实时生成新的列表页,把原本 100% 跳出的失效流量转为商品访问。
- AI 自动化投放优化通过 Vibe Coding 搭建 SEO 投放平台,把趋势洞察、关键词策略、智能选品、页面模板和任务状态集中配置;串联页面生成、URL 批量生产与定时投放,形成从策略配置到规模化上线的自动化链路,稳定承接周维 2W+ URL,运营效率提升 70%,驱动渠道 GMV 同比提升 188%。
LIVE PAGE · TRIP.COM搜索意图到体验商品的实时承接查看页面
用户直接说想法,界面自动绑定指代对象与范围
一句话停帧圈画多人批注02 HOW I BUILD AI PRODUCTS
把复杂的模型能力
变成自然的人机协作
这里展示三种会反复出现在我工作中的产品特质,以及它们如何落进真实交互。
让人自然表达
用停帧、圈画、时间戳与自然语言自动绑定指代关系,让用户直接说想法,无需反复澄清对象和范围。
让 Agent 结构化理解
把自然表达转译为修改对象、修改范围、修改颗粒度与保留边界,让 Agent 准确理解哪里要改、影响多大、什么不能变。
让意图稳定变成行动
结合多模态理解、Context Engineering 与 Agent Harness,用可体验原型验证技术路径,让理解稳定转化为可执行结果。
AIGC 成片生成后的多轮审片与返修
场景发生在 AIGC 已经生成多镜头成片之后创意团队围绕画面持续审片、协商与返修让 Agent 始终理解哪里要改、怎么改、什么不能变
生成第一版只是开始多轮改片才是难点
AIGC 可以快速给出第一版成片,但真实创作不会一次结束。用户会在观看中不断发现问题、补充偏好、回应他人意见,并基于上一轮结果继续返修。难点是让每一轮反馈都与正确镜头、时间点、画面证据和历史决策保持连接。
对话框承接不了 AIGC 成片后的多轮协商
修改意见发生在具体画面与上一轮结果中,脱离视频的对话会让反馈与生成上下文、历史决策逐轮分离。
- 01输入框打断审片流程
用户需要暂停视频、跳到输入框描述问题,再回到画面确认;注意力在“看”和“写”之间反复切换,连续的审片判断被拆散。
- 02引用颗粒度与问题颗粒度错位
生成视频通常以分镜为最大引用单位,但真实修改往往发生在某一秒、某一帧或某个对象上。镜头、时间戳和对象都要由用户重复说明。
- 03对话流难以承载多人协作
创意、品牌、后期与投放意见散落在不同轮对话里;进入下一轮生成后,哪些已确认、哪些待修改、哪些存在冲突都难以继承。
让人围绕成片协商,让 Agent 继承每轮修改
把评论、时间戳、圈画和协作者放回 AIGC 成片现场。系统将每条自然表达绑定到生成版本、镜头 Prompt、画面证据与修改边界,形成下一轮返修可以继续使用的结构化状态。
- 01边看边评
意见钉在播放时刻,观看与表达保持在同一条流程里。
- 02自动定位
同步记录分镜 ID、全片时间、镜头内时间、当前帧与圈画对象。
- 03多轮继承
同一镜头的多人意见先被合并,Agent 记录已确认项、修改项与保持项,并带入下一轮生成。
人看到什么
用户围绕 AIGC 成片直接指出问题、补充期望,并与团队协商下一版要改什么。
Agent 得到什么
- version / shot
- V3 · SHOT_03
- global / local time
- 00:02.4 · 00:00.27
- visual evidence
- 当前帧 + 圈画合成图
- source context
- 镜头 Prompt · 素材 · 角色意见
- change / preserve
- 调整持罐角度 / 保留真实情绪
- plan output
- 意见合并 · 修改边界 · 下一轮返修计划
结构化数据包让 Agent 继承当前版本、镜头 Prompt、多人意见与历史修改边界,先形成方案,再进入下一轮局部生成。
- 01观看生成版在成片中发现问题
- 02自然表达评论 · 时间戳 · 圈画
- 03协商并合并多人意见 · 修改边界
- 04进入下一轮Agent 局部返修
观看一轮 AIGC 成片后的协商与返修
从观看生成版、停帧圈画、多人意见合并,到 Agent 形成下一轮修改方案。
LUMO 青柠气泡饮
一支由 AIGC 生成的四镜头广告初版:冰桶钩子 → 开罐微距 → 真人饮用 → 产品收尾。接下来演示团队如何围绕成片协商,并把意见交给 Agent 进入下一轮返修。
- 观看 AIGC 生成初版
- 停帧圈画并协商意见
- Agent 合并后进入返修
好的 Agent 交互,把简单留给人,把复杂留给 Agent人只需自然表达意图,Agent 架构与 Harness 负责理解意图、补全信息、规划任务、调用工具,并对执行结果进行校验
李浩源 · 创意总监持罐角度再自然一点,保留现在的真实情绪。