模型简介
jina-vlm 是Jina AI的视觉语言模型,结合图片内容与语言任务,面向看图问答、图表理解和视觉资料分析。
这个型号的上下文窗口为 32K;参数规模为 2.4B。Jina AI 的模型主要解决搜索与资料处理问题,包括向量嵌入、相关性重排、多向量检索、视觉理解和网页内容转换。
这个版本怎样理解
使用时以完整型号 jina-vlm 为准。同一系列的其他版本可能改变输入范围、默认行为或运行配置,升级前可先对照下方参数与官方说明。
版本与模型标识
| 模型名称 | jina-vlm |
|---|---|
| 标识类型 | 官方模型标识 |
| 完整型号 / 标识 | jina-vlm |
| 版本状态 | 官方目录收录 |
能力与参数
| 上下文窗口 | 32K |
|---|---|
| 参数规模 | 2.4B |
用问题引导看图
提供清晰图片并说明需要定位的区域或问题。读取图表时,应要求答案指出对应项目、单位和数值;识别文档时,对照原图检查阅读顺序和小字。
实际使用时重点看什么
图像理解与图像生成是不同能力。高分辨率、图像数量和预处理方式都会影响输入条件,模型看见某个区域也不代表每个细节都能准确读取。
价格与使用条件
官方使用与计费说明 ↗。在线调用、产品订阅和自行部署的资源成本分别计算,具体以所选服务与模型许可为准。