机构
*
Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
;
State Key Laboratory of Cognitive Intelligence, iFLYTEK(认知智能国家重点实验室)
专题命中
文档图表理解
:vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI
How does Watermarking Affect Visual Language Models in Document Understanding?
Chunxue Xu, Yiwei Wang, Bryan Hooi, Yujun Cai, Songze Li
机构
*
Southeast University, China(东南大学)
;
University of California, Merced, USA(加州大学默塞德分校)
;
National University of Singapore, Singapore(新加坡国立大学)
;
The University of Queensland, Australia(昆士兰大学)
专题命中
文档图表理解
:visual language model(title,abstract);分类 cs.CV、cs.LG
Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models
通过分类引导的大型视觉语言模型从文档中提取视觉信息
Huafu Li, Guo Chen, Jia Xia, Lei Wang, Wei Du, Yun Yao, Weijun Peng, Liming Li
机构
*
China Mobile Information Technology Co., Ltd.(中国移动信息技术有限公司)
;
School of Information Science and Engineering, NingboTech University(宁波诺丁汉大学信息科学与工程学院)
Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
视觉-语言模型将头部方向误认为注视方向:非语言对话线索
Zory Zhang, Pinyuan Feng, Bingyang Wang, Tianwei Zhao, Suyang Yu, Qingying Gao, Hokin Deng, Ziqiao Ma, Yijiang Li, Dezhi Luo
机构
*
Brown University(布朗大学)
;
Columbia University(哥伦比亚大学)
;
Emory University(埃默里大学)
;
Johns Hopkins University(约翰霍普金斯大学)
;
University of Washington(华盛顿大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
University of Michigan(密歇根大学)
;
UC San Diego(圣地亚哥大学)
Transcription and Recognition of Italian Parliamentary Speeches Using Vision-Language Models
使用视觉-语言模型进行意大利议会演讲的转录与识别
Luigi Curini, Alfio Ferrara, Giovanni Pagano, Sergio Picascia
机构
*
Università degli Studi di Milano(米兰大学)
;
Department of Social and Political Sciences(社会科学系)
;
Department of Literary Studies, Philology and Linguistics(文学研究、语言学与语言学系)
;
Department of Computer Science(计算机科学系)
Commentsto be published in: ParlaCLARIN V: Interoperability, Multilinguality, and Multimodality in Parliamentary Corpora, organized within the 15th Language Resource and Evaluation Conference (2026)
OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models
OmniParser V2:结构化思维点用于统一的视觉文本解析及其在多模态大语言模型中的通用性
Wenwen Yu, Zhibo Yang, Jianqiang Wan, Sibo Song, Jun Tang, Wenqing Cheng, Yuliang Liu, Xiang Bai
机构
*
School of Information Science and Engineering, East China University of Science and Technology(东华大学信息科学与工程学院)
;
School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)
;
School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)
;
School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)
;
Alibaba Group(阿里巴巴集团)
专题命中
文档图表理解
:multimodal large language model(title,abstract);分类 cs.CV