
摘要:上下文长度限制是多模态理解模型面临的技术挑战。VITA 3.0支持更长的上下文与更连续的时间线理解,通过帧采样策略、分辨率控制等方式,提供上下文长度优化的参考方案。
在多模态理解模型中,上下文长度指的是模型在一次推理过程中能够处理的信息量。对于视频理解任务,上下文包括视频帧的视觉信息、音频信息、以及用户提供的文本指令。
由于视频包含时间维度,较长时长的视频会产生更多的帧数据,从而占用更多的上下文长度。当视频时长增加时,如何在有限的上下文长度内保留尽可能多的有效信息,是多模态模型需要解决的问题。
当输入内容超过模型的上下文长度限制时,可能需要进行截断处理,导致部分信息丢失。对于视频理解任务,这可能意味着视频后半段的内容无法被模型完整理解。
上下文长度限制也影响着模型对长视频中时序关系的理解能力。如果模型的上下文长度不足以覆盖整个视频,那么模型可能无法捕捉到视频开头和结尾之间的关联性。
根据产品文档中的说明,VITA 3.0在视频理解框架上升级,支持更长的上下文与更连续的时间线理解。在长视频结构化、分镜拆解、内容摘要等任务上,这一能力使得VITA能够处理较长时间的视频内容。
VITA单次可处理最长30分钟的长视频。在这一时长范围内,VITA可以对视频内容进行连续的理解,捕捉事件之间的时序关系和演进逻辑。
VITA 3.0单次最高支持600MB长视频的处理(接口默认是100MB,600MB需要以白名单的形式来添加)。较大的文件支持能力,使得VITA能够处理较高分辨率或较长时长的视频文件,而无需进行过多的预处理。
VITA在长视频结构化、分镜拆解、内容摘要等任务上,支持更连续的时间线理解。这一能力使得模型能够在理解视频内容时,保持对时间线上各片段之间关联性的理解,从而提供更为完整和准确的理解结果。
VITA的视频按1 frames/s进行帧采样。这一采样率的设置,是在上下文长度限制下,平衡理解效果和Token消耗的一种方式。
较低的帧采样率意味着在相同的上下文长度内,可以处理更长时间的视频。对于内容变化较慢的视频,1 frames/s的采样率通常可以在保留关键视觉信息的同时,将上下文占用控制在合理范围内。
VITA的视觉输入统一放缩到448×448分辨率,编码为256 Tokens进入模型。这一处理方式控制了单帧的Token消耗,从而在上下文长度限制下,可以处理更多的帧数。
在实际使用中,可以根据任务需求选择合适的输入分辨率。产品文档中提供了不同分辨率对应的单图Token消耗参考:640×360为108 Tokens,1280×720为421 Tokens,1920×1080为972 Tokens,2560×1440为1713 Tokens。选择较低的分辨率可以在相同的上下文长度内处理更多的帧。
VITA的音频按12.5 Hz采样进入模型。较低的音频采样率有助于控制音频部分的Token消耗,从而在上下文长度限制下,保留更多的视觉信息空间。
对于带音频的视频理解任务,音频采样策略与帧采样策略共同作用,决定了整体的上下文占用情况。
对于超过30分钟建议时长的视频,可以采用分段处理的方式。将长视频切分为多个30分钟以内的片段,分别提交给VITA进行处理,然后再将各段的理解结果进行整合。
分段处理时,可以根据内容逻辑进行切分(如按照章节、按照主题等),而不是简单地按照固定时长切分。这样有助于保持每个片段内容的完整性。
产品文档中建议,尽量使用明确、具体的指令,避免模糊表述。需要输出特定格式时在指令中明确说明。
在上下文长度有限的情况下,优化Prompt的长度也有助于节省上下文空间。精简Prompt,降低指令Token消耗,可以为视频帧和音频信息留出更多的上下文空间。
根据产品文档中的说明,对于批量处理场景,建议先进行小批量测试,确认效果后再大规模使用。在上下文长度优化方面,也可以通过小批量测试,找到适合自身业务需求的配置方案。
根据产品文档中的说明,Token消耗的计算公式为:总Token消耗 = 指令Token消耗 + 图片数向上取偶 × 单图Token消耗。
对于视频理解任务,视频被采样为一定数量的帧,每帧作为一张"图片"进入模型。因此,视频的时长、帧采样率、以及每帧的分辨率,都会影响到总的Token消耗,进而影响到对上下文长度的需求。
在多数多模态理解模型的计费模式中,Token消耗与计费直接相关。因此,上下文长度优化不仅影响模型的理解效果,也影响着使用成本。
在能力水平与市面同类产品相近的情况下,VITA整体定价约为主流竞品的50%。这一成本优势使得在进行上下文长度优化时,可以在效果与成本之间找到较为平衡的配置方案。
VITA提供两个可用模型:vita-video-3.0(支持视频画面不含音频和图片)和vita-video-long(支持视频含画面和音频和图片)。
在上下文长度优化中,如果任务不需要理解音频信息,可以选择vita-video-3.0模型,从而将上下文空间更多地分配给视觉帧的处理。
根据产品文档中的使用建议,视频时长建议控制在30分钟以内,以保证理解效果。超出建议时长可能影响理解的连续性与准确性。
对于长视频的理解结果,建议进行人工核验,特别是对于时间边界的准确性和事件关联的合理性进行核查。
上下文长度优化是一个持续的过程。随着业务需求的变化和模型能力的升级,可以定期重新评估当前的配置策略是否仍然合适,并进行相应的调整。
上下文长度限制是多模态理解模型面临的技术挑战。VITA 3.0通过支持更长的上下文与更连续的时间线理解,为长视频理解任务提供了技术基础。
通过帧采样策略、分辨率控制、音频采样策略等优化方式,用户可以在上下文长度限制下,找到适合自身业务需求的理解效果与成本平衡方案。
想要体验VITA的长上下文理解能力并测试优化方案?可访问腾讯云TokenHub平台免费试用,每个账号赠送100万Token额度:https://console.cloud.tencent.com/tokenhub/multimodal?modelId=youtu-vita
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。