开云体育还转换性地提议 Slow-Fast 双路编码机制-云开yun体育登录入口Kaiyun官网首页

发布日期:2026-08-16 07:22    点击次数:131

开云体育还转换性地提议 Slow-Fast 双路编码机制-云开yun体育登录入口Kaiyun官网首页

能看懂视频并进行跨模态推理的大模子 Keye-VL 1.5开云体育,快手开源了。

比较此前的预览版块,Keye-VL 1.5 的时序定位能力进一步升级,况且相沿跨模态推理。

还转换性地提议 Slow-Fast 双路编码机制,给模子带来了 128k 的超长险阻文窗口,而且速率与细节兼顾。

获利上,不仅在 Video-MME 短视频基准斩获 73.0 的高分,还在通用、视频和推理场景的大批 Benchmark 当中领跑同级模子。

视频元素 0.1 秒级定位,还相沿推理

要说 Keye-VL-1.5 最大的亮点,询查团队以为主要有三个,也等于开首提到的 128k 险阻文、杰出的短视频相识能力、 以及更强的 Reasoning 能力。

在视频相识场景当中,这三项能力大约同期得以展现。

开端是时序信息相识,Keye-VL-1.5 大约准确判断特定物品在视频中出现的时候点,而且精准到 0.1 秒级。

比如在这段 26 秒带货视频片断中,先容了一款充电宝,其中一个要害是将其装进包包,以体现便于捎带。

Keye-VL-1.5 看完这段视频后,准确报告出了其中包包出现的时候—— 22.3-23.8 秒。

而其他模子或者时候只精准到秒而且还不准确,或者干脆不说时候,径直数起了镜头。

再来是描写能力,Keye-VL-1.5 大约详备描写视频画面场景和细节。

举例关于上头这段视频,Keye-VL-1.5 给出了这么的描写:

况且 Keye-VL-1.5 还具备视频推理能力,大约把柄前序视频内容猜度后续事件发生原因。

在这段宠物视频当中,大狗作念出了一个咬小狗耳朵的动作,而 Keye-VL-1.5 要分析大狗为什么要咬。

其实谜底在视频当中依然以翰墨的体式写了出来,然则 Keye-VL-1.5 的解说愈加详备,并进一步用视频中的后续变化来加强我方的不雅点。

跑分方面,Keye-VL-1.5 在多项公开 Benchmark 以及里面评测中都拿到了同尺寸模子中的最高分。

在 MMBench、OpenCompass 等详细类基准中,Keye-VL-1.5 的获利均特殊 Qwen2.5-VL 7B,并取得多个 SOTA。

在图像推理强关连的 AI2D、OCRBench 等数据蚁合,也均超出同级其他模子。

针对视频相识,Keye 在 Video-MME、TempCompass 和 LongVideoBench 上,获利一样当先于 Qwen2.5-VL 7B 等模子。

包含视觉的数学与逻辑推理维度上,Keye 也保捏了当先上风。

除了这些公开数据集,Keye 团队还构建了 200 条面向短视频应用的里面多维度评测。

Keye-VL-1.5-8B 在东谈主类标注的五神志标(正确性、完满性、关连性、流通度、创造性)上赢得 3.53 分的详细获利,较预览版块擢升了 0.51 分,也跨越了手脚对比的竞品模子。

那么,Keye-VL 是奈何竣事的呢?

视频相识,也用上了快慢想考模子架构和快慢编码计策

举座筹办上,Keye-VL-1.5 取舍了"视觉 Transformer(ViT)+MLP 投影器 + 讲话解码器"的三段式架构。

ViT 将输入图像或视频帧切成 14 × 14 的 patch 序列,用自属观念捕捉全局空间关系。

该 ViT 在运转动时径直摄取 SigLIP-400M 参数,SigLIP 是一种图文对比预磨练行为,可让视觉特征自然带有语义对皆能力。

为了在不裁剪的情况下处理轻易区分率,团队对 ViT 添加了"原生疏辨率"相沿,操作上先把皆备位置向量插值到轻易尺寸,再引入 2DRoPE(二维旋转位置编码)增强高区分率外推。

ViT 输出的 patch 特征经由两层 MLP 投影器送入讲话解码器,讲话端取舍 Qwen3-8B,并在其位置编码中加入 3DRoPE。

3DRoPE 是在传统二维旋转角的基础上再加多一维"时候 / 深度"角度,目的是让文本 token 与视觉 token 按长入时序排序。

针对视频的高帧率与高区分率矛盾,Keye-VL-1.5 还转换性地提议 Slow-Fast 编码计策。

模子开端会对市欢帧作念 patch 级余弦相似度讨论,若与最近一次"慢帧"(又称变化帧,低帧数高区分率)相似度>95% 则判定为"快帧" (又称静止帧,高帧数低区分率),不然记号为新"慢帧"。

处理时,慢帧保留高区分率,快帧分派慢帧 30% 的 token 预算,再结合二分搜索,大约让总预算精准落在限定内,并在序列里插入时候戳特殊记号以标注帧界。

通过这种视频快慢编码计策,Keye 竣事了性能与讨论资本的灵验均衡。

四阶段渐进式预磨练

预磨练选择四阶段渐进活水线,按照"先单模后多模、先对皆后扩窗"的功令张开:

Stage0,视觉编码器预磨练:仅用 SigLIP 对比亏损接续磨练 ViT,强化视觉语义,顺应里面数据散布;

Stage1,跨模态对皆:冻结 ViT 与 Qwen,只磨练 MLP 投影器进行大鸿沟跨模态对皆;

Stage2,多任务预磨练:解冻全集结,在 8K 险阻文下端到端优化,增强模子的基础视觉相识能力;

Stage3,退火磨练: 在精选高质地数据上进行微调,引入长险阻文模态数据,把险阻文拉长到 128K。

整个预磨练语料跨越 1 万亿 token,数据源既包含 LAION、DataComp、CC12M 等公开多讲话图文库,也有大鸿沟自建图像、视频与文本。

四阶段落幕后,Keye 团队对不同数据配比磨练的"同质"权重与针对 OCR、数学等薄弱项单独强化得到的"异质"权重进行模子交融,以减小偏差并擢升鲁棒性。

"同质模子"指的是在退火期取舍疏通集结结构和相似任务主见,但调度数据配比、样本难度或速即种子磨练出的多份骨干权重,这些模子彼此性能散布接近;

"异质模子"则是诈欺与骨干不同的专用数据域进行进一步精调而生成的大家权重,举例团队针对车牌、单据和街景翰墨特殊集结 / 合成数据磨练出的 OCR-Expert。

由于两边架构一致,交融进程不错通过径直权重插值竣事,不引入推理时特殊支出,却能将大家的局部能力注入通用模子。

Post-training

Keye-VL-1.5 的磨练后处理包含四个主要阶段:

第一步用监督微调结合多偏好优化(MPO)栽培输出质地基线;

第二步通过五步活水线的大鸿沟链式想考数据冷启动,为模子提供可靠的推理示范;

第三步在可考据奖励框架下取舍 GSPO 算法并团结渐进辅导采样作念多轮强化学习,系统化擢升通用推理能力;

临了一步以章程 - 生成式 - 模子三源奖励完成对皆强化学习,重心加强指示辞退、时势一致性与用户偏好一致性。

在监督微调阶段,团队先构建包含 750 万多模态问答的候选池,用 TaskGalaxy 将样本映射到七万种任务标签,再刻意提高高难度类型的占比。

随后参加 MPO,以 25 万开源、15 万纯文本和 2.6 万东谈主工样本为基底,诈欺 Keye-Reward 模子分数和东谈主工评估构造险阻质配对,通过偏好亏损函数让模子在归拢问题上倾向得分更高的谜底,从而进一步擢升报告质地。

有了质地可控的谜底后,模子借助链式想考冷启动活水线速即补皆推理深度,先自动生成带时势的解答,再由第二模子冉冉打分进行分级,中档样本经东谈主工精修后复审,高分样本径直入库,为后续强化学习提供可靠冷启动权重。

接下来参加通用强化学习,系统开端按照样本难度分组,然后诈欺 GSPO 在组内基于序列蹙迫性权重裁剪上风函数,缓解长序列梯度不稳。

当推理能力趋于治理后,磨练转入临了的对皆阶段。

章程奖励通过正则和 AST 瓦解强制查验 JSON、Markdown 等结构与内容安全,生成式奖励由外部大模子评估逻辑一致性与讲话作风,模子奖励则来自 Keye-Reward 模子的细粒度偏好分。

三类信号动态加权,使最终模子既能辞退指示又能保捏时势正确并合适用户偏好,同期灵验裁减无依据生成风险。

团队效果屡次亮相顶会

说到快手大模子,咱们可能更正经视频生成模子可灵,但本色上,快手在其他类型的大模子上一样有很强的实力。

打造 Keye-VL 的 Keye 团队,是快手里面专注多模态大讲话模子研发的中枢 AI 部门,主攻视频相识、视觉感知与推理等前沿主见。

Keye 团队以为,整合视觉、讲话和行为等多源数据的智能体,关于解锁更深档次的领路和方案至关蹙迫。

现在,Keye 团队依然领有大批效果,在本年的多个顶会上密集发布。

ICML 2025 上,Keye 团队提议了多模态 RLHF 框架 MM-RLHF(2502.10391),通过 120k 东谈主类偏好对比与品评式奖励模子,显赫擢升 MLLM 安全性及对皆性能。

KDD 2025 上,视觉讲话模子管理框架 VLM as Policy(2504.14904)赢得了最好论文提名。

该框架通过 VLM 驱动内容质地与风险判定,显赫提高短视频审核服从与准确率。

CVPR 2025 上,Keye 团队也发布了两项效果。

交错图文多模态数据集 CoMM(2406.10462),提供了高一致性图文叙事样本,从而增强模子图文穿插相识与生成能力。

视觉 token 压缩加快算法 LibraMerging,取舍位置驱动合并,在无需再磨练的情况下大幅裁减推理支出。

还有 ICLR 2025 中,Keye 有三项询查效果亮相,包括一种优化算法和两个数据集。

MoE 模子优化算法 STGC(2406.19905),不错检测 token 梯度破损并进行重路由,擢升大家诈欺率与治理速率。

视频对话相识基准 SVBench(2502.10810),构建了时序多轮问答链,评测 LVLM 在流式长视频场景的推理水平。

还有视觉任务指示数据集 TaskGalaxy(2502.09925),不错自动生成万级层级任务与 40 万余样本,增强模子跨任务泛化能力。

在快手里面,Keye 团队的这一系列效果,正在为短视频内容审核、智能编著、搜索与互动保举等业务场景提供底层 AI 能力。

Keye 正在把多模态时期从本质环境推向千万级泛泛场景,考据复杂视频相识在着实业务中可行且高效,为同类时期的工程化落地提供了径直样本。

时期论述:

https://arxiv.org/pdf/2509.01563

代码:

https://github.com/Kwai-Keye/Keye/blob/main/Kwai_Keye_v1_5.pdf

模子权重:

https://huggingface.co/Kwai-Keye/Keye-VL-1.5-8B

在线 DEMO:

https://huggingface.co/spaces/Kwai-Keye/Keye-VL-1_5-8B

一键三连「点赞」「转发」「留意心」

接待在褒贬区留住你的想法!

—  完  —

� � 点亮星标 � �

科技前沿线路逐日见开云体育