Chart2SVG: Editable SVG Generation from Raster Chart Images
Chart2SVG:从栅格图表图像生成可编辑的SVG
Jinning Cui, Lu Chen, Haoyan Shi, Yue He, Chenglong Wang, Mengyu Zhou, Weidong Huang, Yunhai Wang
机构
*
Renmin University of China(中国人民大学)
;
State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)
;
Shandong University(山东大学)
;
Microsoft Research(微软研究院)
;
Qwen Large Model Application Team, Alibaba(阿里巴巴通义大模型应用团队)
;
University of Technology Sydney(悉尼科技大学)
专题命中
文档图表理解
:vision-language model(abstract);multimodal large language model(abstract);分类 cs.LG
FLARE: A Failure-Aware Framework for Autonomous Correction and Recovery in Visual-Language Robotic Manipulation
FLARE:一种面向视觉-语言机器人操纵中自主修正与恢复的故障感知框架
Ganlong Zhao, Zijia Tang, Xingping Chen, Zhanghui Kuang, Ye Tian, Guanbin Li
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
Centre for Perceptual and Interactive Intelligence(感知与交互智能中心)
;
Duke University(杜克大学)
;
Sun Yat-sen University(中山大学)
;
TengenX(天工科技)
;
Tencent Robotics X(腾讯Robotics X实验室)
;
Shenzhen Loop Area Institute(深圳河套学院)
;
Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)
MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models
MVC-Bench:医学视觉-语言模型的校准基准测试
Ashshak Sharifdeen, Shihab Aaqil Ahamed, Ufaq Khan, Muhammad Akhtar Munir Sujair Ibrahim, Mohamed Rafeek Mareer Ahamed, Yutong Xie, Imran Razzak, Muhammad Haris Khan
机构
*
Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学)
;
Sabaragamuwa University of Sri Lanka(斯里兰卡萨巴拉加穆瓦大学)
;
Digital Platform Development, SLT PLC(SLT公共有限公司数字平台开发部)
VIPER: An Expert-Curated Benchmark for Vision-Language Models in Veterinary Pathology
VIPER:用于兽医病理学视觉语言模型的专家策划基准
Luca L. Weishaupt, Simone de Brot, Javier Asin, Llorenç Grau-Roma, Nic G. Reitsam, Andrew H. Song, Dongmin Bang, Stefan T. Kaluziak, Long Phi Le, Jakob Nikolas Kather, Faisal Mahmood, Guillaume Jaume
机构
*
Harvard-MIT HST(哈佛-麻省理工卫生科学与技术部)
;
Mass General Brigham(麻省总医院布里格姆医疗系统)
;
Harvard Medical School(哈佛医学院)
;
COMPATH, University of Bern(伯尔尼大学COMPATH)
;
UC Davis(加州大学戴维斯分校)
;
University of Augsburg(奥格斯堡大学)
;
UT MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)
;
TU Dresden(德累斯顿工业大学)
;
University of Lausanne(洛桑大学)
Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
在域转移下对用于乳腺钼靶成像的基础模型的稳健性进行基准测试
Giang Nguyen, Raghav Mehta, Emma A.M. Stanley, Tian Xia, Thi Hao Nguyen, Hieu Pham, Ben Glocker
机构
*
College of Engineering and Computer Science, VinUniversity(工程与计算机科学学院,文大大学)
;
Imperial College London(伦敦帝国理工学院)
;
Radiology Department, Vietnam National Cancer Hospital(越南国家癌症医院放射科)
;
VinUni-Illinois Smart Health Center, VinUniversity(文大大学 - 伊利诺伊智能健康中心,文大大学)
;
The Computer Vision and Medical AI Lab, VinUniversity(计算机视觉与医学人工智能实验室,文大大学)
PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference
PACE:用于快速视觉语言模型推理的统一压缩-提取范式
Junjie Liu, Shengyuan Ye, Xu Chen
机构
*
Sun Yat-sen University(中山大学)
;
Power Dispatch Control Center, Guangdong Power Grid Co., Ltd.(广东电网有限责任公司电力调度控制中心)
;
Shenzhen Loop Area Institute(深圳河套学院)
ReViCo: Unveiling the Limitations of VLMs in Visual Text Understanding via Error Correction
ReViCo:通过纠错揭示视觉语言模型在视觉文本理解中的局限性
Bojun Zhang, Junhong Liang, Feifei Zhai, Fengxian Ji, Yu Zhou
机构
*
Institute of Automation, CAS(中国科学院自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
Zhongke Fanyu Technology Co., Ltd(中科梵语科技有限公司)
专题命中
VLM训练与架构
:vision language model(abstract,abstract_cn);VLM(abstract,abstract_cn);分类 cs.CV
机构
*
Southern University of Science and Technology(南方科技大学)
;
Microsoft Research Asia(微软亚洲研究院)
;
Shanghai University of Finance and Economics(上海财经大学)
;
Peking University(北京大学)
专题命中
VLM训练与架构
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
机构
*
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
;
LinkedIn Corporation(领英公司)
;
Northeastern University(东北大学)
;
University of California, Davis(加州大学戴维斯分校)
机构
*
Meituan(美团)
;
MoE Key Lab of Artificial Intelligence(MoE人工智能重点实验室)
;
AI Institute(人工智能研究院)
;
School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)
;
MAIS&NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中
VLM训练与架构
:multimodal large language model(abstract);分类 cs.LG