多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

JoyAI-VL-Interaction 未来路线图:AdaCodec预测视频编码与长流交互的下一步

JoyAI-VL-Interaction 未来路线图:AdaCodec预测视频编码与长流交互的下一步 JoyAI-VL-Interaction 未来路线图AdaCodec预测视频编码与长流交互的下一步【免费下载链接】JoyAI-VL-InteractionJoyAI-VL-Interaction: An Open Real-time Video-Language Interaction System项目地址: https://gitcode.com/gh_mirrors/jo/JoyAI-VL-InteractionJoyAI-VL-Interaction是一个完全开源的实时视频语言交互系统一个 8B 规模的交互模型 四百万条时间对齐训练数据 五个可插拔服务组成的可部署系统。本文梳理它的官方路线图——唯一未完成的 TODO 是搭载预测式视频编码器AdaCodec的模型版本而数据规模化、长流记忆与 Agent 委托则是长流交互的下一步方向。 先看清楚路线图走到哪一步了官方在 README.zh-CN.md 中维护了一份公开的 TODO 清单可以直接当作进度条来读项目状态发布交互模型博客 / 部署系统代码 / 技术报告✅ 已完成发布时间对齐交互训练数据✅ 已完成在线 离线统一模型流式交互 离线视频理解二合一✅ 已完成最优推理配置RTX 3090 / 5090 调优方案✅ 已完成量化版本INT4 / INT8 / FP8 / NVFP4 四档权重✅ 已完成Codec 版本AdaCodec 预测式视频编解码器⏳进行中可以看到能降本的量化、能合一的在线离线统一都已经落地剩下最核心的就是AdaCodec——它是长流交互能否真正跑得起的关键。 为什么需要 AdaCodec长流的 token 成本问题实时交互模型有一个隐藏的成本黑洞token 预算。模型要每秒都在场就必须持续观看视频流。如果每一帧都以完整细节送入模型一小时直播产生的 token 量会随时间线性膨胀长流场景下既贵又慢。AdaCodec预测式视频编码器的思路很直接官方架构文档中的描述是对可预测的帧只消耗少量 token在场景真正变化时保留完整细节。也就是说它像一个聪明的剪辑师画面没变如静止的桌面、平稳的摄像头视角就只花几个 token 描述和上一帧差不多画面突变火焰窜起、有人闯入才输出全部细节。这样 token 预算与信息量挂钩而不是与时间长度挂钩——长流交互的成本曲线被拉平了。技术细节可参考技术报告 JoyAI-VL-Interaction-Reportv1.pdf 与架构文档 doc/architecture.zh-CN.md。️ 长流交互的下一步路线图详解1️⃣ 数据规模化把时间对齐数据做大官方明确表示当前训练使用的交互数据400 万条时间对齐片段规模仍然不大但即便如此模型已经涌现出一些从未显式教授的能力例如在变化的应用界面中引导购物者操作。数据仓库位于 datasets/官方判断继续扩展时间对齐数据 训练配方 系统是让模型走得更远的主路径。对新手来说这份数据格式和转换脚本convert_data.py本身就是学习如何构造交互数据的范本。2️⃣ 系统侧五服务架构已为长流做好准备从系统架构看长流能力其实已经有了骨架架构图出自 doc/architecture.zh-CN.md右侧的Models Memory区域值得关注系统把记忆分成工作记忆 → 中期 → 长期三级并通过 memory_summarizer.py 做记忆摘要与回填backfill。这是长流交互区别于单轮问答的核心——模型要在数小时的流中记住发生过什么。3️⃣ Agent 委托把难任务交给后台模型每个秒级决策只有三种说话、保持静默、委托。委托链路已可用——background-agent 服务负责把复杂子任务比如生成代码、深度分析交给后台模型异步处理主交互模型则继续盯流不被阻塞。这条实时循环 异步循环的双通道设计是长流场景中保持低延迟的关键。4️⃣ 部署与硬件适配继续压低成本已发布四档量化权重INT4 / INT8 / FP8 / NVFP4通过 install/download-models.sh 一键下载配合 install.sh 即可完成完整安装已提供针对RTX 3090 / 5090的最优推理配置提供 container/ 下的 Docker Compose 方案按16GB / 24GB 显存档位分级适配。 终极目标不请自来的在场感官方描绘的下一个瞬间是你结束漫长的一天疲惫回家还没开口一个安静的声音就注意到你说我能看出你很累了今天一定很辛苦吧。这种未经请求的在场感正是交互模型而非回合制模型要解决的问题——路线图的所有条目本质上都在为这一刻铺路。 参考坐标当前的能力基线在 26 个标准视频理解基准上当前统一模型平均分57.53对比 Qwen3-VL-8B-Instruct 的 54.16 提升 3.37 分流式视频Streaming Video类别提升最明显ODVBench 12.50。路线图上的每一步AdaCodec、数据扩展、长流记忆都会在这条基线之上继续加码。 新手如何跟进这份路线图如果你想亲手体验当前的系统、见证后续版本的能力变化最快捷的方式git clone https://gitcode.com/gh_mirrors/jo/JoyAI-VL-Interaction cd JoyAI-VL-Interaction ./install/install.sh --with-all ./install/download-models.sh --all ./services/scripts/run.sh minimal然后打开浏览器访问https://127.0.0.1:8099即可看到实时交互界面。遇到部署问题可查 doc/troubleshooting.zh-CN.md想用本地摄像头/RTSP 推流做长流测试参考 doc/rtsp_streaming.zh-CN.md完整的分步部署请看 doc/getting_started.zh-CN.md。一句话总结JoyAI-VL-Interaction 的路线图 已交付实时在场正在交付看得起长流AdaCodec与记得住长流数据规模化 三级记忆最终指向一个无需你开口就先察觉你的 AI。【免费下载链接】JoyAI-VL-InteractionJoyAI-VL-Interaction: An Open Real-time Video-Language Interaction System项目地址: https://gitcode.com/gh_mirrors/jo/JoyAI-VL-Interaction创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表