CODEC-STREAM VIDEO UNDERSTANDING
视觉语言模型
Glint-VL-Video-8B 是首个以“码流(Codec-Stream)”为视觉单元的视频理解大模型。模型能够在长时序内容中识别关键事件、定位发生区间并提取有效证据,帮助业务快速获取视觉内容中的关键信息,适用于视频审核、内容检索与过程分析。
- 长视频理解
- 时序定位
- 事件检索
LLaVA-OneVision-2.0 全栈模型优化服务
Glint-VL-Video-8B 基于团队自研并开源的 LLaVA-OneVision 技术体系,面向政企行业场景,提供从模型优化、任务适配到部署交付的原厂定制服务。
MODEL TRAINING & REFINEMENT
由 LLaVA 社区LLaVA 社区是全球开源多模态人工智能领域的重要创新力量,持续推动视觉理解与大语言模型的深度融合。社区的重要贡献在于推动了“视觉指令微调(Visual Instruction Tuning)”技术路线的发展,使模型不仅能够识别图像内容,还能够围绕图片、文档和视频进行多轮问答、逻辑分析与任务执行。LLaVA 通过开放模型代码、训练方法、数据构建思路与评测体系,显著降低了多模态模型研究和应用开发的门槛,并为后续视觉语言模型在图像理解、OCR、图表分析、长视频理解、空间推理等方向的持续演进提供了重要基础。依托开放、可复现、可扩展的技术生态,LLaVA 社区正在加速多模态 AI 在智能客服、内容创作、教育、工业检测、机器人等场景中的创新应用。提供从基础训练、参数高效微调到知识蒸馏的全栈模型优化服务,并通过客观评测和生产部署形成完整闭环。数据留在客户现场,能力沉淀在客户模型中。
围绕行业数据和目标任务构建训练集、训练配方与版本基线,支持 VLM 4B、8B 模型训练。
采用 SFT、LoRA、QLoRA 等方式,让通用模型快速掌握客户任务、行业知识和输出规范。
将大模型知识和业务推理能力迁移到更小模型,兼顾效果、推理速度和私有化部署成本。
GLINT-VL MODEL FAMILY
以领先的视频理解能力为核心,并针对安防与银行物理空间持续精炼,让通用多模态智能真正理解行业现场。
CODEC-STREAM VIDEO UNDERSTANDING
Glint-VL-Video-8B 是首个以“码流(Codec-Stream)”为视觉单元的视频理解大模型。模型能够在长时序内容中识别关键事件、定位发生区间并提取有效证据,帮助业务快速获取视觉内容中的关键信息,适用于视频审核、内容检索与过程分析。
SECURITY-SPECIALIZED MODEL
Glint-VL-SE-8B 基于海量安防图片构建领域精调训练集,采用指令精调技术强化模型对安防场景、重点事件和复杂目标的理解能力,大幅提升重点事件识别效果,并显著增强对人员、车辆及其细粒度属性的识别准确率,为泛安防业务提供更稳定的垂域视觉智能能力。
BANKING PHYSICAL-WORLD MODEL
Glint-VL-BK-8B
V1.0针对银行网点、金库、办公楼等真实场所进行专项训练,识别人员行为、重点事件、安全风险与运营合规问题,为银行安防管理和日常运营提供持续、可追溯的智能分析能力。
BANKING INTELLIGENCE
物理空间持续理解
风险与合规分析
关联人员行为、重点事件、发生区域与关键证据。
PRODUCTS BUILT ON MODELS
在城市管理中组合通用视频与安防专项模型;在银行领域,由通用大模型处理知识与材料任务,银行专项模型理解网点、金库和办公楼等物理空间。
CITY
通用视频模型负责长视频事件和过程理解,安防专项模型识别城市治理事件、人员车辆及细粒度属性。
FINANCE
通用大模型与 OCR 负责流水、财报和尽调材料处理;BK-8B 负责网点、金库、办公楼等物理空间的安防管理与运营合规分析。
GLINT LAB MODEL ECOSYSTEM
研究成果覆盖 VLM、视觉基座、多模态嵌入、多模态 RAG、人脸识别与三维视觉方向。
视觉基座
统一处理图像与视频理解任务的视觉编码器
视觉基座
区域级监督的视觉表征学习方法
视觉基座
应用多标签信号的视觉表征学习方法,通用视觉基础模型。
视觉基座
通用且特征紧凑的图像检索表征学习框架
视觉基座
统一处理图像与视频理解任务的视觉编码器
多模态嵌入
更精细的跨模态语义对齐的通用多模态嵌入模型
多模态嵌入
多模态大语言模型的通用嵌入学习框架
多模态嵌入
多模态图文交错数据集
多模态嵌入
提升图文预训练模型组合理解能力的对齐框架
多模态嵌入
自适应融合原始和生成文本的图文预训练方法
多模态嵌入
基于后Transformer架构RWKV的视觉-语言表征学习模型
多模态嵌入
高效的将大型视觉语言模型的知识迁移至小模型CLIP蒸馏方法
多模态嵌入
面向文本行人检索的跨模态对齐框架
多模态RAG
面向文档检索增强生成(RAG)系统的综合评测基准
三维视觉
基于重力-视图坐标系的世界基准人体运动恢复方法
三维视觉
基于扩散自回归模型的流式运动生成框架,
三维视觉
利用视频扩散模型场景先验进行辐射场重建的统一框架,提升稀疏视图下的三维重建鲁棒性
三维视觉
利用二维运动数据提升三维运动生成的方法,仅有2D标注的情况下生成多样化三维动作
三维视觉
二维数据预训练实现单目多视图三维运动恢复的框架