arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-13 至 2025-10-13 共收录 241 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 54 篇

2510.08612 2025-10-13 cs.SE cs.AI 77%

Impact of LLMs on Team Collaboration in Software Development

Devang Dhanuka

机构 * MS Data Science Program(数据科学项目) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08603 2025-10-13 cs.CL 77%

YpathRAG:A Retrieval-Augmented Generation Framework and Benchmark for Pathology

Deshui Yu, Yizhi Wang, Saihui Jin, Taojie Zhu, Fanyi Zeng, Wen Qian, Zirui Huang, Jingli Ouyang, Jiameng Li, Zhen Song, Tian Guan, Yonghong He

机构 * Tsinghua University Shenzhen International Graduate School(清华大学深圳国际研究生院) China Unicom Guangdong Branch(中国unicom广东分公司) Department of Network Intelligence, Peng Cheng Laboratory(网络智能系,鹏城实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09361 2025-10-13 cs.CV 75%

BLINK-Twice: You see, but do you observe? A Reasoning Benchmark on Visual Perception

Junyan Ye, Dongzhi Jiang, Jun He, Baichuan Zhou, Zilong Huang, Zhiyuan Yan, Hongsheng Li, Conghui He, Weijia Li

机构 * Sun Yat-sen University(中山大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多模态实验室) Peking University(北京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

Comments Accepted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09183 2025-10-13 cs.CY cs.HC 75%

Student Development Agent: Risk-free Simulation for Evaluating AIED Innovations

Jianxiao Jiang, Yu Zhang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09058 2025-10-13 cs.SE 75%

Model-Assisted and Human-Guided: Perceptions and Practices of Software Professionals Using LLMs for Coding

Italo Santos, Cleyton Magalhaes, Ronnie de Souza Santos

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08598 2025-10-13 physics.soc-ph stat.AP 75%

Mapping Socio-Economic Divides with Urban Mobility Data

Yingche Liu, Mengyang Li

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Urban Computing, Bike-Sharing Systems, Socio-economic Inequality, Data Enrichm

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09302 2025-10-13 cs.CV cs.AI cs.CL 73%

CapGeo: A Caption-Assisted Approach to Geometric Reasoning

Yuying Li, Siyi Qian, Hao Liang, Leqi Zheng, Ruichuan An, Yongzhen Guo, Wentao Zhang

机构 * THU(清华大学) PKU(北京大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07545 2025-10-13 cs.CL cs.LG 73%

Deploying Tiny LVLM Judges for Real-World Evaluation of Chart Models: Lessons Learned and Best Practices

Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Ridwan Mahbub, Mizanur Rahman, Amran Bhuiyan, Israt Jahan, Mir Tafseer Nayeem, Shafiq Joty, Enamul Hoque, Jimmy Huang

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学) Salesforce AI Research(Salesforce AI研究)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

Comments Accepted to the EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08608 2025-10-13 cs.CL cs.AI 73%

MMA-ASIA: A Multilingual and Multimodal Alignment Framework for Culturally-Grounded Evaluation

Weihua Zheng, Zhengyuan Liu, Tanmoy Chakraborty, Weiwen Xu, Xiaoxue Gao, Bryan Chen Zhengyu Tan, Bowei Zou, Chang Liu, Yujia Hu, Xing Xie, Xiaoyuan Yi, Jing Yao, Chaojun Wang, Long Li, Rui Liu, Huiyao Liu, Koji Inoue, Ryuichi Sumida, Tatsuya Kawahara, Fan Xu, Lingyu Ye, Wei Tian, Dongjun Kim, Jimin Jung, Jaehyung Seo, Nadya Yuki Wangsajaya, Pham Minh Duc, Ojasva Saxena, Palash Nandi, Xiyan Tao, Wiwik Karlina, Tuan Luong, Keertana Arun Vasan, Roy Ka-Wei Lee, Nancy F. Chen

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research, Singapore(新加坡科技研究局) Indian Institute of Technology Delhi(印度理工学院德里分校) Alibaba DAMO Academy(阿里巴巴达摩院) Microsoft Research Asia(微软亚洲研究院) Shanghai University of Finance and Economics(上海财经大学) Inner Mongolia University(内蒙古大学) Kyoto University(京都大学) Jiangxi Normal University(江西师范大学) Korea University(韩国大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09519 2025-10-13 cs.CL 70%

Can We Reliably Rank Model Performance across Domains without Labeled Data?

Veronica Rammouz, Aaron Gonzalez, Carlos Cruzportillo, Adrian Tan, Nicole Beebe, Anthony Rios

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 8 pages + references and Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09266 2025-10-13 cs.CL 70%

CFVBench: A Comprehensive Video Benchmark for Fine-grained Multimodal Retrieval-Augmented Generation

Kaiwen Wei, Xiao Liu, Jie Zhang, Zijian Wang, Ruida Liu, Yuming Yang, Xin Xiao, Xiao Sun, Haoyang Zeng, Changzai Pan, Yidan Zhang, Jiang Zhong, Peijin Wang, Yingchao Feng

机构 * Chongqing University(重庆大学) Independent Researcher(独立研究者) University of the Chinese Academy of Sciences(中国科学院大学) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08936 2025-10-13 cs.CV cs.AI 70%

RO-Bench: Large-scale robustness evaluation of MLLMs with text-driven counterfactual videos

Zixi Yang, Jiapeng Li, Muxi Diao, Yinuo Jing, Kongming Liang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08783 2025-10-13 cs.HC cs.AI 70%

MLLM as a UI Judge: Benchmarking Multimodal LLMs for Predicting Human Perception of User Interfaces

Reuben A. Luera, Ryan Rossi, Franck Dernoncourt, Samyadeep Basu, Sungchul Kim, Subhojyoti Mukherjee, Puneet Mathur, Ruiyi Zhang, Jihyung Kil, Nedim Lipka, Seunghyun Yoon, Jiuxiang Gu, Zichao Wang, Cindy Xiong Bearfield, Branislav Kveton

机构 * University of California, Berkeley(加州大学伯克利分校) Adobe Research(Adobe研究) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08624 2025-10-13 cs.CL 70%

Do LLMs Know They Are Being Tested? Evaluation Awareness and Incentive-Sensitive Failures in GPT-OSS-20B

Nisar Ahmed, Muhammad Imran Zaman, Gulshan Saleem, Ali Hassan

机构 * Sparkverse AI Ltd(Sparkverse AI有限公司) Department of Informatics and Systems(信息学与系统系) University of Management and Technology(管理与技术大学) Faculty of Information Technology and Computer Science(信息科技与计算机科学学院) University of Central Punjab(旁遮普大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09507 2025-10-13 cs.CV cs.RO 67%

PhysToolBench: Benchmarking Physical Tool Understanding for MLLMs

Zixin Zhang, Kanghao Chen, Xingwang Lin, Lutao Jiang, Xu Zheng, Yuanhuiyi Lyu, Litao Guo, Yinchuan Li, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Beihang University(北航大学) Knowin

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08978 2025-10-13 cs.CV 67%

HandEval: Taking the First Step Towards Hand Quality Evaluation in Generated Images

Zichuan Wang, Bo Peng, Songlin Yang, Zhenchen Tang, Jing Dong

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20711 2025-10-13 cs.HC cs.RO 67%

Automating eHMI Action Design with LLMs for Automated Vehicle Communication

Ding Xia, Xinyue Gui, Fan Gao, Dongyuan Li, Mark Colley, Takeo Igarashi

机构 * The University of Tokyo(东京大学) University College London(伦敦大学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Accepted as findings for EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09499 2025-10-13 cs.CV cs.AI cs.LG 62%

A methodology for clinically driven interactive segmentation evaluation

Parhom Esmaeili, Virginia Fernandez, Pedro Borges, Eli Gibson, Sebastien Ourselin, M. Jorge Cardoso

机构 * School of Biomedical Engineering and Imaging Sciences, KCL, UK(生物医学工程与成像科学学院) Siemens Healthineers, Princeton NJ, USA(西门子医疗)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI、cs.LG

Comments 10 pages, Medical Image Computing and Computed Assisted Intervention 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08867 2025-10-13 cs.AI cs.CL 62%

ReviewerToo: Should AI Join The Program Committee? A Look At The Future of Peer Review

Gaurav Sahu, Hugo Larochelle, Laurent Charlin, Christopher Pal

机构 * Mila – Quebec AI Institute(魁北克AI研究所) HEC Montréal(蒙特利尔高等商学院) ServiceNow Research(ServiceNow研究) Université de Montréal(蒙特利尔大学) Canada CIFAR Chair(加拿大 CIFAR 席位) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08827 2025-10-13 cs.SE cs.AI cs.CL cs.CY 62%

McMining: Automated Discovery of Misconceptions in Student Code

Erfan Al-Hossami, Razvan Bunescu

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17068 2025-10-13 cs.MA cs.CL 57%

Anemoi: A Semi-Centralized Multi-agent System Based on Agent-to-Agent Communication MCP server from Coral Protocol

Xinxing Ren, Caelum Forder, Qianbo Zang, Ahsen Tahir, Roman J. Georgio, Suman Deb, Peter Carroll, Önder Gürcan, Zekun Guo

机构 * Coral Protocol Brunel University of London(布伦埃尔大学) SnT, Université du Luxembourg(Luxembourg 理工学院 SnT 分院) University of Hull(哈罗德大学) National University of Computer and Emerging Sciences(国家计算机与新兴科学大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12882 2025-10-13 cs.CL 57%

ViClaim: A Multilingual Multilabel Dataset for Automatic Claim Detection in Videos

Patrick Giedemann, Pius von Däniken, Jan Deriu, Alvaro Rodrigo, Anselmo Peñas, Mark Cieliebak

机构 * Zurich University of Applied Sciences(苏黎世应用科学大学) UNED NLP & IR Group(UNED自然语言处理与信息检索组)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21787 2025-10-13 cs.CV cs.CL 57%

DeHate: A Stable Diffusion-based Multimodal Approach to Mitigate Hate Speech in Images

Dwip Dalal, Gautam Vashishtha, Anku Rani, Aishwarya Reganti, Parth Patwa, Mohd Sarique, Chandan Gupta, Keshav Nath, Viswanatha Reddy, Vinija Jain, Aman Chadha, Amitava Das, Amit Sheth, Asif Ekbal

机构 * MIT Media Lab, USA(麻省理工学院媒体实验室) Stanford University, USA(斯坦福大学) Amazon GenAI, USA(亚马逊生成人工智能) University of South Carolina, USA(南卡罗来纳大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments Defactify 3 workshop at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08885 2025-10-13 cs.RO cs.AI 57%

AirScape: An Aerial Generative World Model with Motion Controllability

Baining Zhao, Rongze Tang, Mingyuan Jia, Ziyou Wang, Fanghang Man, Xin Zhang, Yu Shang, Weichen Zhang, Wei Wu, Chen Gao, Xinlei Chen, Yong Li

机构 * Shenzhen International Graduate School, Tsinghua University Pengcheng Laboratory Shenzhen China School of Computer Science \& Technology, Beijing Institute of Technology Beijing China Department of Automation, Tsinghua University Beijing China Communication Engineering College, Northeastern University Qinhuangdao China Shenzhen International Graduate School, Tsinghua University Shenzhen China Department of Electronic Engineering, Tsinghua University Beijing China BNRist, Tsinghua University Beijing China Department of Electronic Engineering, Tsinghua University BNRist, Tsinghua University Beijing China Shenzhen International Graduate School, Tsinghua University Pengcheng Laboratory School of Computer Science \& Technology, Beijing Institute of Technology Department of Automation, Tsinghua University Communication Engineering College, Northeastern University Shenzhen International Graduate School, Tsinghua University Department of Electronic Engineering, Tsinghua University BNRist, Tsinghua University Department of Electronic Engineering, Tsinghua University BNRist, Tsinghua University

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12493 2025-10-13 cs.AI 57%

GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning

Longxi Gao, Li Zhang, Pengzhi Gao, Wei Liu, Jian Luan, Mengwei Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Unaffiliated(无隶属机构)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09320 2025-10-13 cs.CV 50%

Hybrid-grained Feature Aggregation with Coarse-to-fine Language Guidance for Self-supervised Monocular Depth Estimation

Wenyao Zhang, Hongsi Liu, Bohan Li, Jiawei He, Zekun Qi, Yunnan Wang, Shengyang Zhao, Xinqiang Yu, Wenjun Zeng, Xin Jin

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能 MOE 实验室,上海交通大学人工智能学院) Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo, China(宁波数字孪生研究所,东技术研究所,宁波,中国) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Ningbo, China(宁波空间智能与数字衍生关键实验室,宁波,中国) University of Science and Technology of China(中国科学技术大学) CASIA Tsinghua University(清华大学)

专题命中 评测与基准 :foundation model(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03948 2025-10-13 cs.CV 50%

ProbRes: Probabilistic Jump Diffusion for Open-World Egocentric Activity Recognition

Sanjoy Kundu, Shanmukha Vellamcheti, Sathyanarayanan N. Aakur

机构 * CSSE Department, Auburn University(计算机科学与工程系,阿伯丁大学)

专题命中 评测与基准 :language model(abstract)

Comments Accepted to ICCV 2025. 17 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 44 篇

2505.21334 2025-10-13 cs.CV 89%

HoliTom: Holistic Token Merging for Fast Video Large Language Models

Kele Shao, Keda Tao, Can Qin, Haoxuan You, Yang Sui, Huan Wang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Salesforce AI Research(Salesforce AI研究院) Columbia University(哥伦比亚大学) Rice University(Rice大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments code link: https://github.com/cokeshao/HoliTom

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09103 2025-10-13 cs.LG 87%

AdaPM: a Partial Momentum Algorithm for LLM Training

Yimu Zhang, Yuanshi Liu, Cong Fang

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,智能科学与技术学院,北京大学) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12444 2025-10-13 cs.CL 86%

Augmenting Compliance-Guaranteed Customer Service Chatbots: Context-Aware Knowledge Expansion with Large Language Models

Mengze Hong, Chen Jason Zhang, Di Jiang, Yuanqin He

机构 * Hong Kong Polytechnic University(香港理工大学) AI Group, WeBank Co., Ltd(WeBank金融科技部)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏