arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 663 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 663 篇

2606.12898 2026-06-12 cs.CV cs.CL 新提交 77%

Magnifying What Matters: Attention-Guided Adaptive Rendering for Visual Text Comprehension

放大关键信息:面向视觉文本理解的注意力引导自适应渲染

Shenglai Zeng, Qirui Wang, Kai Guo, Xinnan Dai, Xianxuan Long, Hui Liu

机构 * Michigan State University(密歇根州立大学) Xi’an Jiaotong University(西安交通大学)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对视觉语言模型在视觉文本理解任务中存在的定位与利用脱节问题,提出无需训练、模型无关的注意力引导自适应渲染方法AGAR,通过放大关键文本跨度提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22192 2026-06-10 cs.CV 版本更新 77%

CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution

CharTide: 数据中心的图表到代码生成通过三视角微调和查询驱动进化

Xiangxi Zheng, Kuang He, Jiayi Hu, Ping Yu, Rui Yan, Yuan Yao, Peng Hou, Anxiang Zeng, Alex Jinpeng Wang

机构 * Nanjing University(南京大学) LLM Team, Shopee Pte. Ltd.(Shopee 联邦学习团队) East China Normal University(华东师范大学) Nanjing University of Science and Technology(南京理工大学) Central South University(中南大学)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出CharTide框架,通过三视角微调解耦视觉感知与代码逻辑,并引入基于信息不变性的查询驱动强化学习进行数据验证,在多个基准上超越GPT-4o。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09578 2026-06-09 cs.AI cs.CL cs.IR 新提交 77%

TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs

TABVERSE:大语言模型与视觉语言模型中跨格式表格理解的基准测试

Momina Ahsan, Sarfraz Ahmad, Ming Shan Hee, Roy Ka-Wei Lee, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)

专题命中 文档图表理解 :VLM(summary_cn);vision-language model(abstract);分类 cs.AI

AI总结 提出TABVERSE基准,通过控制表格内容、跨多种结构格式(HTML、Markdown、LaTeX)和渲染图像,系统评估LLM和VLM在问答、结构理解和结构重建任务中的表现,发现表示格式显著影响表格理解能力。

Comments 24 pages, 18 tables, 16 figures, Submitted to ARR May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25956 2026-06-05 cs.CV 77%

RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing

RAPTOR+: 一种基于视觉的视觉-语言框架,用于提高自动化癌症转诊处理中的临床信任度和可审计性

Sofiat Abioye, Ufaq Khan, Shazad Ashraf, Anusha Jose, Adam Byfield, Lukman Akanbi, Muhammad Bilal

机构 * Birmingham City University(伯明翰城市大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) University Hospitals Birmingham NHS Foundation Trust(伯明翰大学医院 NHS 基础信托) NHS England(英格兰国家卫生服务体系)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 提出RAPTOR+多模态框架,通过微调视觉-语言模型实现端到端转诊理解,在结直肠癌转诊表单上显著提升提取准确性和证据定位能力。

Comments 12 pages 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00902 2026-06-02 cs.AI 77%

Ryze: Evidence-Enriched Data Synthesis from Biomedical Papers

Ryze:从生物医学论文中合成富含证据的数据

Yeqi Huang, Yue Chen, Yanwei Ye, Guanhao Su, Luo Mai

机构 * University of Edinburgh(爱丁堡大学)

专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.AI

AI总结 提出 Ryze 系统,自动从生物医学论文中生成包含完整证据结构的训练数据,并训练出领域专用 VLM BioVLM-8B,在 LAB-Bench 上以低于 200 美元成本达到 48.0% 加权准确率。

Comments Accepted at ACL 2026 System Demonstrations Track. 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30917 2026-06-01 cs.IR cs.CV 77%

Inference-Free Multimodal Learned Sparse Retrieval for Production-Scale Visual Document Search

无推理多模态学习稀疏检索用于生产级视觉文档搜索

Gyu-Hwung Cho, Youngjune Lee, Kiyoon Jeong, Siyoung Lee, Sanggyu Han, Hervé Dejean, Stéphane Clinchant, Seung-won Hwang

机构 * NAVER Corp.(NAVER公司) Seoul National University(首尔国立大学) Naver Labs Europe(Naver欧洲实验室)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 提出V-SPLADE,一种无需推理的稀疏检索器,通过标题门控令牌监督解决视觉稀疏表示中的词汇基础问题,在视觉文档检索中达到稠密级效果。

Comments 12 pages, 5 figures, 12 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26656 2026-05-27 cs.CV 77%

DV-SFT: Direct Vision Supervision for Fine-Grained Visual Understanding

DV-SFT: 直接视觉监督用于细粒度视觉理解

Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Bing Wang, Zhixing Tan

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Zhongguancun Academy(中关村学院) Beihang University(北航) Zhongguancun Laboratory(中关村实验室) Southeast Academy of Information Technology, Beijing Institute of Technology(北京理工大学信息科学技术东南学院)

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出DV-SFT方法,通过为视觉令牌构建显式令牌级监督信号,利用OCR场景中的直接视觉-文本对应关系,在不修改模型架构或增加前向传播的情况下,显著提升多模态大语言模型的细粒度视觉理解能力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19866 2026-05-20 cs.CV 77%

Structured Layout Priors for Robust Out-of-Distribution Visual Document Understanding

用于鲁棒性文档理解的结构化布局先验

Peter El Hachem, Ahmed Nassar, A. Said Gurbuz, Christoph Auer, Peter W. J. Staar

机构 * ETH Zurich(苏黎世联邦理工学院) IBM Research(IBM研究院)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种结构化布局先验,通过在解码器之外运行轻量级RT-DETR检测器,将检测结果转换为解析器的DocTags词汇,并注入到提示中,以解决文档布局解析中的两跳瓶颈问题,从而提升文档理解的鲁棒性。

Comments 18 pages, 7 figures. Main text: 9 pages (4 figures); Appendix: 9 pages (3 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13415 2026-05-12 cs.IR cs.CL cs.CV 77%

Attention Grounded Enhancement for Visual Document Retrieval

基于注意力的视觉文档检索增强

Wanqing Cui, Wei Huang, Yazhi Guo, Yibo Hu, Meiguang Jin, Junfeng Ma, Keping Bi

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出AGREE框架,通过多模态大语言模型的注意力机制引导检索器识别相关文档区域,提升细粒度相关性建模,实验表明在ViDoRe V2基准上显著优于传统方法。

Comments Published as a conference paper at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07492 2026-05-11 cs.CV 77%

How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings

文档解析距离解决还有多远?PureDocBench:一个跨干净、退化和现实场景的可追溯基准测试

Zhiheng Li, Zongyang Ma, Jiaxian Chen, Jianing Zhang, Zhaolong Su, Yutong Zhang, Zhiyin Yu, Ruiqi Liu, Xiaolei Lv, Bo Li, Jun Gao, Ziqi Zhang, Chunfeng Yuan, Bing Li, Weiming Hu

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学技术大学) NWPU(西北工业大学) JLU(吉林大学) USTC(中国科学技术大学) PKU(北京大学) HelloGroup ShanghaiTech(上海科技大学) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京多模态信息超级智能安全重点实验室)

专题命中 文档图表理解 :VLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 本文提出PureDocBench,一个可追溯的基准测试,覆盖10个领域、66个子类和1475页文档,包含清洁、数字退化和现实退化三种版本。评估40种模型发现,文档解析尚未解决,最佳模型得分仅74分,公式识别仍是瓶颈,通用VLM在退化下表现不如专用模型。

Comments 42 pages, 20 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05688 2026-01-12 cs.CV 77%

SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More

SketchVL:通过细粒度信用分配进行政策优化以实现图表理解和更多

Muye Huang, Lingling Zhang, Yifei Li, Yaqiang Wu, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University, China(计算机科学与技术学院,西安交通大学) MOE KLINNS Lab, Xi’an Jiaotong University, China(教育部KLINNS实验室,西安交通大学) Zhongguancun Academy, Beijing, China(中关村学院,北京)

专题命中 文档图表理解 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 SketchVL通过细粒度信用分配优化,提升多模态大语言模型在图表理解和多领域推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09286 2025-09-12 cs.CV 77%

Visual Programmability: A Guide for Code-as-Thought in Chart Understanding

Bohao Tang, Yan Ma, Fei Zhang, Jiadi Su, Ethan Chern, Zhulin Hu, Zhixin Wang, Pengfei Liu, Ya Zhang

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09764 2025-04-15 cs.CV 77%

Socratic Chart: Cooperating Multiple Agents for Robust SVG Chart Understanding

Yuyang Ji, Haohan Wang

专题命中 文档图表理解 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18521 2024-06-27 cs.CL cs.CV 77%

CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs

Zirui Wang, Mengzhou Xia, Luxi He, Howard Chen, Yitao Liu, Richard Zhu, Kaiqu Liang, Xindi Wu, Haotian Liu, Sadhika Malladi, Alexis Chevalier, Sanjeev Arora, Danqi Chen

专题命中 文档图表理解 :InternVL(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments 121 pages, 90 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08100 2024-06-13 cs.CL cs.AI 77%

Multimodal Table Understanding

Mingyu Zheng, Xinwei Feng, Qingyi Si, Qiaoqiao She, Zheng Lin, Wenbin Jiang, Weiping Wang

专题命中 文档图表理解 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

Comments 23 pages, 16 figures, ACL 2024 main conference, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16821 2024-05-01 cs.CV 77%

How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites

Zhe Chen, Weiyun Wang, Hao Tian, Shenglong Ye, Zhangwei Gao, Erfei Cui, Wenwen Tong, Kongzhi Hu, Jiapeng Luo, Zheng Ma, Ji Ma, Jiaqi Wang, Xiaoyi Dong, Hang Yan, Hewei Guo, Conghui He, Botian Shi, Zhenjiang Jin, Chao Xu, Bin Wang, Xingjian Wei, Wei Li, Wenjian Zhang, Bo Zhang, Pinlong Cai, Licheng Wen, Xiangchao Yan, Min Dou, Lewei Lu, Xizhou Zhu, Tong Lu, Dahua Lin, Yu Qiao, Jifeng Dai, Wenhai Wang

专题命中 文档图表理解 :InternVL(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13349 2026-03-17 cs.CV cs.AI 76%

MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval

MURE:基于视觉-语言模型的多分辨率编码框架用于视觉文档检索

Fengbin Zhu, Zijing Cai, Yuzhe Wang, Pengyang Shao, Wenjie Wang, Fuli Feng, Richang Hong, Tat-Seng Chua

机构 * National University of Singapore, Singapore(新加坡国立大学) University of Science and Technology of China, China(中国科学技术大学) Hefei University of Technology, China(合肥工业大学)

专题命中 文档图表理解 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 本文提出MURE框架,通过多分辨率采样编码、跨粒度特征融合和语义感知聚类机制,提升视觉文档检索效率与效果,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26339 2025-10-31 cs.CV cs.AI 76%

GLYPH-SR: Can We Achieve Both High-Quality Image Super-Resolution and High-Fidelity Text Recovery via VLM-guided Latent Diffusion Model?

Mingyu Sung, Seungjae Ham, Kangwoo Kim, Yeokyoung Yoon, Sangseok Yun, Il-Min Kim, Jae-Mo Kang

机构 * Department of Artificial Intelligence(人工智能系) Kyungpook National University(庆尚国立大学) Department of Electrical and Computer Engineering(电气电子工程系) Queen’s University(皇后大学) Department of Information and Communications Engineering(信息与通信工程系) Pukyong National University(浦项国立大学)

专题命中 文档图表理解 :VLM(title);分类 cs.CV、cs.AI

Comments 11 pages, 6 figures. Includes supplementary material. Under review as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09722 2025-09-15 cs.CV cs.CL cs.LG 76%

Improving MLLM Historical Record Extraction with Test-Time Image

Taylor Archibald, Tony Martinez

机构 * Brigham Young University

专题命中 文档图表理解 :MLLM(title);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04642 2024-11-08 cs.CV cs.AI 76%

TAP-VL: Text Layout-Aware Pre-training for Enriched Vision-Language Models

Jonathan Fhima, Elad Ben Avraham, Oren Nuriel, Yair Kittenplon, Roy Ganz, Aviad Aberdam, Ron Litman

专题命中 文档图表理解 :vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20295 2026-08-10 cs.LG cs.AI cs.CV 版本更新 75%

Judge a Book by its Cover: Investigating Multi-Modal LLMs for Multi-Page Handwritten Document Transcription

通过封面判断书籍:调查多模态大语言模型用于多页手写文档转录

Benjamin Gutteridge, Matthew Thomas Jackson, Toni Kukurin, Xiaowen Dong

机构 * University of Oxford(牛津大学) QuantCo

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究多模态大语言模型在多页手写文档转录中的应用,提出OCR+PAGE-1和OCR+PAGE-N策略,通过共享页面内容提升转录效果。

Comments 10 pages (36 including references and appendices), 11 figures, accepted at COLM 2026, earlier version accepted at AAAI 2025 Workshop on Document Understanding and Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18839 2026-07-22 cs.CL 新提交 75%

HPD-Parsing: Hierarchical Parallel Document Parsing

HPD解析:分层并行文档解析

Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan, Yangliu Xu, Manhui Lin, Xiaolong Ma, Cheng Cui, Tengyu Du, YY

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 研究基于统一视觉语言模型的文档解析器顺序瓶颈问题,提出HPD解析,采用分层并行解码范式,含主要布局分支和P-MTP,实验显示其吞吐量高且精度有竞争力,为高效统一文档解析开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19960 2026-06-19 cs.IR 新提交 75%

Stellar: Scalable Multimodal Document Retrieval for Natural Language Queries

Stellar:面向自然语言查询的可扩展多模态文档检索

Yuxiang Guo, Zhonghao Hu, Yuren Mao, Yuhang Liu, Congcong Ge, Xiaolu Zhang, Jun Zhou, Yunjun Gao

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)

AI总结 提出Stellar框架,通过磁盘存储令牌级文档嵌入并动态加载候选嵌入,结合词汇表示过滤和高效磁盘支持的后交互,在保持检索效果的同时将内存开销和查询延迟降低1-2个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09851 2026-06-10 cs.HC 新提交 75%

ECHO: Explainable Co-editing with Human-in-the-loop Operations for Presentation Refinement

ECHO: 基于人在环操作的可解释协同编辑用于演示文稿优化

Yu Fu, Yongqi Kang, Yujia Zhou, Yong Zhao

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract_cn);grounding(abstract)

AI总结 针对演示文稿创作中用户缺乏细粒度控制的问题,提出ECHO系统,通过多模态意图理解和可解释操作计划,结合“自然语言+视觉选择”范式和解耦的“计划-确认-执行”循环,实现可控的局部编辑,显著降低认知负荷并提升意图映射与空间定位准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09435 2026-06-09 cs.CL 新提交 75%

MUDIDI: A Two-Stage Framework for Multilingual Dictionary Digitization with Language Models

MUDIDI:一种基于语言模型的多语言词典数字化两阶段框架

David Setiawan, Temuulen Khishigsuren, Milind Agarwal, Pagnarith Pit, Aso Mahmudi, Ekaterina Vylomova

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) Melbourne School of Psychological Sciences, The University of Melbourne(墨尔本大学墨尔本心理科学学院) LILT

专题命中 文档图表理解 :vision-language model(abstract);vision language model(abstract);VLM(abstract_cn)

AI总结 提出MUDIDI两阶段框架,结合语言模型实现多语言词典数字化,在字符识别、标记保留和词条分割上优于现有OCR和视觉语言模型,并发布30本公共领域词典的标注数据集。

Comments 9 pages, preprint, submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12983 2026-06-05 cs.CL 75%

ChartAttack: Testing the Vulnerability of LLMs to Malicious Prompting in Chart Generation

ChartAttack: 测试大型语言模型在图表生成中对恶意提示的脆弱性

Jesus-German Ortiz-Barajas, Jonathan Tonglet, Vivek Gupta, Iryna Gurevych

机构 * INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT索菲亚大学"圣克莱门特·欧赫里迪斯基") Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(无处不在知识处理实验室(UKP实验室)、计算机科学系、图腾达姆斯塔特大学和应用网络安全国家研究中心ATHENE) Arizona State University(亚利桑那州立大学)

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)

AI总结 本文提出ChartAttack框架,用于评估多模态大语言模型在生成误导性图表方面的能力,通过注入误导性元素来诱导错误解释,并引入AttackViz数据集来评估和改进模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17163 2026-05-27 cs.LG cs.AI cs.CL cs.CV 75%

OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning

OCR-Reasoning基准:揭示MLLMs在复杂文本丰富图像推理中的真实能力

Mingxin Huang, Yongxin Shi, Dezhi Peng, Songxuan Lai, Zecheng Xie, Lianwen Jin

机构 * South China University of Technology(华南理工大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 文档图表理解 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出OCR-Reasoning基准,包含1069个人工标注样本,覆盖6种核心推理能力和18个实际推理任务,通过双标注(最终答案和逐步推理过程)评估多模态大语言模型在文本丰富图像推理中的能力,发现最先进模型准确率均低于50%。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08962 2026-05-12 cs.DC 75%

MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production

MegaScale-Omni: 一种面向多模态大语言模型生产训练的超大规模、工作负载容错系统

Chunyu Xue, Yangrui Chen, Jianyu Jiang, Ningxin Zheng, Junda Feng, Jingji Chen, Shixiong Zhao, Shen Yan, Yi Lin, Lei Shi, Zanbo Wang, Lishu Luo, Faming Wu, Haibin Lin, Xin Liu, Yanghua Peng, Quan Chen

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)

AI总结 本文提出MegaScale-Omni系统,通过解耦并行策略、统一表示和负载平衡技术,提升多模态大语言模型在动态工作负载下的训练效率,实现1.27倍至7.57倍的吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23691 2026-04-28 eess.SP 75%

Intention-Aware Semantic Agent Communications for AI Glasses

面向AI眼镜的意图感知语义代理通信

Peiwen Jiang, Fangyu Liu, Jiajia Guo, Chao-Kai Wen, Shi Jin, Jun Zhang

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 本文提出一种意图感知的语义代理通信框架,通过用户意图引导数据传输,减少带宽消耗并保持任务性能,适用于AI眼镜的轻量级预处理场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04997 2026-04-08 cs.IR cs.AI cs.CL cs.CV cs.LG 75%

Evaluation of Embedding-Based and Generative Methods for LLM-Driven Document Classification: Opportunities and Challenges

嵌入式与生成方法在LLM驱动文档分类中的评估:机遇与挑战

Rong Lu, Hao Liu, Song Hou

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文比较了基于嵌入和生成模型在地学技术文档分类中的表现,发现增强的生成视觉-语言模型在零样本准确率上表现更优,但监督微调对训练数据不平衡敏感。

Comments Accepted at the IMAGE'25 Workshop (PCW-11), Society of Exploration Geophysicists (SEG). Published version available at https://doi.org/10.1190/image2025-w11-03.1

详情

展开后加载摘要…

URL PDF HTML 收藏