机构
*
National Taiwan University(国立台湾大学)
;
Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所)
;
Radboud University(拉德堡德大学)
;
Institut Jean Nicod(让·尼科研究所)
PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models
PsychoSafe:在大语言模型中引发基于心理学的拒绝
Gianluca Barmina, Federico Torrielli, Sven Harms, Jacob Nielsen, Felix Mächtle, Stine Lyngsø Beltoft, Peter Schneider-Kamp, Thomas Eisenbarth, Lukas Galke Poech, Anne Lauscher
机构
*
University of Southern Denmark(南丹麦大学)
;
University of Turin(都灵大学)
;
University of Hamburg(汉堡大学)
;
University of Lübeck(吕贝克大学)
机构
*
Fuzhou University(福州大学)
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs
TABVERSE:大语言模型与视觉语言模型中跨格式表格理解的基准测试
Momina Ahsan, Sarfraz Ahmad, Ming Shan Hee, Roy Ka-Wei Lee, Preslav Nakov
机构
*
Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)
;
Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)
机构
*
School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院)
;
Melbourne School of Psychological Sciences, The University of Melbourne(墨尔本大学墨尔本心理科学学院)
;
LILT
专题命中
文档图表理解
:vision-language model(abstract);vision language model(abstract);VLM(abstract_cn)
MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework
MM-Matryoshka:通过二维多模态套娃训练框架实现预算弹性视觉文档检索
Haowen Xiang, Yibo Yan, Jiahao Huo, Yu Huang, Yi Cao, Mingdong Ou, Xuming Hu
机构
*
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Alibaba Cloud Computing(阿里云计算)
;
Hong Kong University of Science and Technology(香港科技大学)
机构
*
State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室)
;
UESTC
;
University of Virginia(弗吉尼亚大学)
;
HKUST(GZ)(香港科技大学(广州))
;
Cornell University(康奈尔大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
专题命中
文档图表理解
:multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.LG
PereStruct: Multimodal Semantic Assembly for Robust Historical Document Parsing
PereStruct: 面向鲁棒历史文档解析的多模态语义组装
Maksim Shandybo, Ivan Bespalov, Daniil Yefimov, Marina Kosheleva, Alexander Loukianov
机构
*
IGIC RAS(俄罗斯科学院信息传输问题研究所)
;
Yandex Cloud
;
National University of Science and Technology MISIS(莫斯科国立钢铁合金学院)
;
Nekrasov Central Universal Scientific Library(涅克拉索夫中央综合科学图书馆)
Decoupling Semantics and Logic: A Training-Free Coarse-to-Fine Pipeline for Video Retrieval-Augmented Generation
解耦语义与逻辑:一种无需训练的从粗到精的视频检索增强生成流水线
Jiaxin Dai, Zehang Wei, Jiamin Yan, Xiang Xiang
机构
*
School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)
;
School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)
FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks
FieldWorkArena:面向真实作业任务的代理AI基准测试
Jun Takahashi, Atsunori Moteki, Akiyoshi Uchida, Shoichi Masui, Fan Yang, Kanji Uchino, Yueqi Song, Yonatan Bisk, Graham Neubig, Ikuo Kusajima, Yasuto Watanabe, Hiroyuki Ishida, Koki Nakagawa, Shan Jiang
机构
*
Fujitsu Limited(富士通株式会社)
;
Fujitsu Research of America(富士通美国研究部)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Master’s Student, The University of Tokyo(东京大学硕士研究生)
;
Agent Research Collective(代理研究集体)
SleepWalk: A Three-Tier Benchmark for Stress-Testing Instruction-Guided Vision-Language Navigation
SleepWalk:一种三层压力测试基准,用于指导的视觉-语言导航
Niyati Rawal, Sushant Ravva, Shah Alam Abir, Saksham Jain, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das
机构
*
Indian AI Research Organization (IAIRO)(印度人工智能研究组织)
;
ĸragya Lab, BITS Pilani Goa(BITS Pilani Goa 的 ĸragya 实验室)
;
University of Dhaka(达卡大学)
;
Delhi Technological University(德里技术大学)
;
Apple(苹果公司)
;
Meta