LLaVA-OneVision-2.0 全栈模型优化服务

让顶尖的 AI 技术成为您的业务生产力

Glint-VL-Video-8B 基于团队自研并开源的 LLaVA-OneVision 技术体系,面向政企行业场景,提供从模型优化、任务适配到部署交付的原厂定制服务。

体验

MODEL TRAINING & REFINEMENT

让私有数据成为专属模型能力

提供从基础训练、参数高效微调到知识蒸馏的全栈模型优化服务,并通过客观评测和生产部署形成完整闭环。数据留在客户现场,能力沉淀在客户模型中。

  1. TRAINING

    模型训练

    围绕行业数据和目标任务构建训练集、训练配方与版本基线,支持 VLM 4B、8B 模型训练。

    • 数据治理与多模态标注
    • 训练过程监控与断点续训
    • 模型版本与实验记录
  2. FINE-TUNING

    模型微调

    采用 SFT、LoRA、QLoRA 等方式,让通用模型快速掌握客户任务、行业知识和输出规范。

    • 低成本参数高效微调
    • 私有盲测与 A/B 对比
    • 效果、成本与交付周期可控
  3. DISTILLATION

    模型蒸馏

    将大模型知识和业务推理能力迁移到更小模型,兼顾效果、推理速度和私有化部署成本。

    • 支持 32B 以下 LLM 蒸馏
    • 量化编译与推理优化
    • 云端、私有环境与边缘部署
  1. 01数据资产
  2. 02训练 / 微调 / 蒸馏
  3. 03评测对齐
  4. 04部署交付

GLINT-VL MODEL FAMILY

多模态感知,深入真实世界

以领先的视频理解能力为核心,并针对安防与银行物理空间持续精炼,让通用多模态智能真正理解行业现场。

CODEC-STREAM VIDEO UNDERSTANDING

视觉语言模型

Glint-VL-Video-8B 是首个以“码流(Codec-Stream)”为视觉单元的视频理解大模型。模型能够在长时序内容中识别关键事件、定位发生区间并提取有效证据,帮助业务快速获取视觉内容中的关键信息,适用于视频审核、内容检索与过程分析。

  • 长视频理解
  • 时序定位
  • 事件检索
视频理解

SECURITY-SPECIALIZED MODEL

泛安防视觉语言模型

Glint-VL-SE-8B 基于海量安防图片构建领域精调训练集,采用指令精调技术强化模型对安防场景、重点事件和复杂目标的理解能力,大幅提升重点事件识别效果,并显著增强对人员、车辆及其细粒度属性的识别准确率,为泛安防业务提供更稳定的垂域视觉智能能力。

  • 重点事件识别
  • 人车属性
  • 指令精调
目标发现

BANKING PHYSICAL-WORLD MODEL

Glint-VL-BK-8B

V1.0

银行物理空间视觉语言模型

针对银行网点、金库、办公楼等真实场所进行专项训练,识别人员行为、重点事件、安全风险与运营合规问题,为银行安防管理和日常运营提供持续、可追溯的智能分析能力。

  • 银行网点
  • 金库安全
  • 办公楼管理
  • 运营合规

PRODUCTS BUILT ON MODELS

把模型能力,交付到业务现场

在城市管理中组合通用视频与安防专项模型;在银行领域,由通用大模型处理知识与材料任务,银行专项模型理解网点、金库和办公楼等物理空间。

CITY

城市管理视觉智能

通用视频模型负责长视频事件和过程理解,安防专项模型识别城市治理事件、人员车辆及细粒度属性。

Video-8BSE-8B城市事件闭环
  • 占道、遗留物、聚集等事件理解
  • 目标轨迹、发生区间和关键证据
  • 接入现有城市管理和视频系统

FINANCE

智慧金融

通用大模型与 OCR 负责流水、财报和尽调材料处理;BK-8B 负责网点、金库、办公楼等物理空间的安防管理与运营合规分析。

通用 LLMBK-8B智慧金融
  • 流水、财报、尽调报告智能体助手
  • 网点、金库和办公楼运营合规识别
  • 本地 32B LLM、OCR、AI 网关与 GBOX

GLINT LAB MODEL ECOSYSTEM

开放研究与自研模型共筑技术底座

研究成果覆盖 VLM、视觉基座、多模态嵌入、多模态 RAG、人脸识别与三维视觉方向。

VLM

开源

LLaVA-OneVision 2.0

统一图像视频的全帧率视觉语言大模型

  • 多模态大模型

VLM

开源

LLaVA-OneVision-1.5

全开源的多模态大语言模型训练框架,

  • 多模态大模型

VLM

AAAI 2026

ViCToR

利用视觉token重建提升多模态大模型的方法、

  • 多模态大语言模型

VLM

CVPR 2026

StreamingRVOS

基于大语言模型的流式参考视频分割方法

  • 流式视频分割
  • 参考分割