GLOSSARY
视觉语言模型(VLM)
既能读图也能读文的模型:发一张截图、图表、照片或示意图,用自然语言提问即可。
VLM 给语言模型加装了一个视觉编码器,把图像变成文本侧同类的 token。结果是一个模型就能描述图片、读懂截图中的文字、解释图表、从发票提取字段,并回答“这个界面哪里有问题?”——无需单独管线的多模态输入。
这一能力已支撑真实产品:读取上传截图的客服工具、理解你当前页面的助手、扫描文档的数据提取。短板仍在——精细小字、精确计数、空间推理与密集坐标轴的图表仍会绊倒模型,这些任务的输出需要与一切抽取任务相同的核验。