arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-22 至 2025-10-22 共收录 233 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 60 篇

2510.18556 2025-10-22 cs.CL 77%

Building Trust in Clinical LLMs: Bias Analysis and Dataset Transparency

Svetlana Maslenkova, Clement Christophe, Marco AF Pimentel, Tathagata Raha, Muhammad Umar Salman, Ahmed Al Mahrooqi, Avani Gupta, Shadab Khan, Ronnie Rajan, Praveenkumar Kanithi

机构 * M42, Abu Dhabi(阿布扎比M42)

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

Comments Accepted to EMNLP Main 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16122 2025-10-22 cs.CL 77%

Text Takes Over: A Study of Modality Bias in Multimodal Intent Detection

Ankan Mullick, Saransh Sharma, Abhik Jana, Pawan Goyal

机构 * IIT Kharagpur, India(印度理工学院Kharagpur) Adobe Research, India(Adobe研究) IIT Bhubaneswar, India(印度理工学院Bhubaneswar)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 Main Conference Full Paper

Journal ref EMNLP 2025 Main Conference Full Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17874 2025-10-22 cs.SE cs.AI 77%

Repairing Tool Calls Using Post-tool Execution Reflection and RAG

Jason Tsay, Zidane Wright, Gaodan Fang, Kiran Kate, Saurabh Jha, Yara Rizk

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18799 2025-10-22 cs.SE 75%

FeClustRE: Hierarchical Clustering and Semantic Tagging of App Features from User Reviews

Max Tiessler, Quim Motger

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18411 2025-10-22 cs.CL cs.LG 73%

DanmakuTPPBench: A Multi-modal Benchmark for Temporal Point Process Modeling and Understanding

Yue Jiang, Jichu Li, Yang Liu, Dingkang Yang, Feng Zhou, Quyu Kong

机构 * Fudan University(复旦大学) Center for Applied Statistics and School of Statistics, Renmin University of China(应用统计中心和中国人民大学统计学院) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算高级创新中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Accepted by Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18368 2025-10-22 cs.CL 70%

KoSimpleQA: A Korean Factuality Benchmark with an Analysis of Reasoning LLMs

Donghyeon Ko, Yeguk Jin, Kyubyung Chae, Byungwook Lee, Chansong Jo, Sookyo In, Jaehong Lee, Taesup Kim, Donghyun Kwak

机构 * Naver Cloud(Naver云) Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18029 2025-10-22 cs.DB cs.AI 70%

DynaQuery: A Self-Adapting Framework for Querying Structured and Multimodal Data

Aymane Hassini

机构 * Al Akhawayn University(阿尔阿克哈文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 15 pages, 2 figures, 10 tables. Source code and experimental artifacts are available at: https://github.com/aymanehassini/DynaQuery . The 'DynaQuery-Eval-5K' benchmark, introduced in this work, is also publicly available at: https://www.kaggle.com/datasets/aymanehassini/dynaquery-eval-5k-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17854 2025-10-22 cs.CV cs.CR cs.LG 70%

Provenance of AI-Generated Images: A Vector Similarity and Blockchain-based Approach

Jitendra Sharma, Arthur Carvalho, Suman Bhunia

机构 * Department of Computer Science and Software Engineering, Miami University, Oxford, Ohio(计算机科学与软件工程系,迈阿密大学,俄亥俄州奥克兰) Farmer School of Business, Miami University, Oxford, Ohio(农学商学院,迈阿密大学,俄亥俄州奥克兰)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18170 2025-10-22 cs.AI cs.ET cs.LG cs.SE math.OC 68%

AgentChangeBench: A Multi-Dimensional Evaluation Framework for Goal-Shift Robustness in Conversational AI

Manik Rana, Calissa Man, Anotida Expected Msiiwa, Jeffrey Paine, Kevin Zhu, Sunishchal Dev, Vasu Sharma, Ahan M R

机构 * Algoverse Microsoft

专题命中 评测与基准 :language model(abstract,comments);分类 cs.AI、cs.LG;large language model(comments)

Comments Accepted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Multi-Turn Interactions in Large Language Models

Journal ref Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18726 2025-10-22 cs.CV 67%

IF-VidCap: Can Video Caption Models Follow Instructions?

Shihao Li, Yuanxing Zhang, Jiangtao Wu, Zhide Lei, Yiwen He, Runzhe Wen, Chenxi Liao, Chengkang Jiang, An Ping, Shuo Gao, Suhan Wang, Zhaozhou Bian, Zijun Zhou, Jingyi Xie, Jiayi Zhou, Jing Wang, Yifan Yao, Weihao Xie, Yingshui Tan, Yanghai Wang, Qianqian Xie, Zhaoxiang Zhang, Jiaheng Liu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments https://github.com/NJU-LINK/IF-VidCap

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18169 2025-10-22 eess.AS cs.SD 67%

Hearing Health in Home Healthcare: Leveraging LLMs for Illness Scoring and ALMs for Vocal Biomarker Extraction

Yu-Wen Chen, William Ho, Sasha M. Vergez, Grace Flaherty, Pallavi Gupta, Zhihong Zhang, Maryam Zolnoori, Margaret V. McDonald, Maxim Topaz, Zoran Kostic, Julia Hirschberg

机构 * The Fu Foundation School of Engineering and Applied Science, Columbia University(哥伦比亚大学福基金会工程与应用科学学院) School of Nursing, Columbia University(哥伦比亚大学护理学院) Center for Home Care Policy & Research, VNS Health(VNS健康居家护理政策与研究中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments The Second Workshop on GenAI for Health at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18158 2025-10-22 cs.HC 67%

Design and Challenges of Mental Health Assessment Tools Based on Natural Language Interaction

Yixue Cai, Xiyan Su, Dongpeng Yao, Rongduo Han, Nan Gao, Haining Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18131 2025-10-22 cs.SE 67%

BlueCodeAgent: A Blue Teaming Agent Enabled by Automated Red Teaming for CodeGen AI

Chengquan Guo, Yuzhou Nie, Chulin Xie, Zinan Lin, Wenbo Guo, Bo Li

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18096 2025-10-22 cs.SE 67%

A Benchmark Dataset And LLMs Comparison For NFR Classification With Explainable AI

Esrat Ebtida Sakib, MD Ahnaf Akib, Md Muktadir Mazumder, Maliha Noushin Raida, Md. Mohsinul Kabir

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18055 2025-10-22 physics.geo-ph 67%

Developing an Open-access Telegram Bot for Automated, estimation and IA-based interpreted of OpenQuake Ground-Motion intensity measures

Boumediene Derras

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments 28 pages, 8 figures, submitted at computers & geosciences journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17998 2025-10-22 cs.CL cs.AI cs.LG 67%

SimBA: Simplifying Benchmark Analysis Using Performance Matrices Alone

Nishant Subramani, Alfredo Gomez, Mona Diab

机构 * Carnegie Mellon University - Language Technologies Institute(卡内基梅隆大学-语言技术研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03197 2025-10-22 cs.CV cs.AI cs.CL cs.LG 67%

Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing

Baode Wang, Biao Wu, Weizhen Li, Meng Fang, Zuming Huang, Jun Huang, Haozhe Wang, Yanjie Liang, Ling Chen, Wei Chu, Yuan Qi

机构 * INFLY Tech(INFLY科技) Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) University of Liverpool(利物浦大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14460 2025-10-22 cs.CV 67%

VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank

Tianhe Wu, Jian Zou, Jie Liang, Lei Zhang, Kede Ma

机构 * City University of Hong Kong(香港城市大学) OPPO Research Institute(OPPO研究院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18104 2025-10-22 cs.IR cs.AI cs.LG 62%

From AutoRecSys to AutoRecLab: A Call to Build, Evaluate, and Govern Autonomous Recommender-Systems Research Labs

Joeran Beel, Bela Gipp, Tobias Vente, Moritz Baumgart, Philipp Meister

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18483 2025-10-22 cs.AI 57%

StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking

Haoran Zhang, Chenhao Zhu, Sicong Guo, Hanzhe Guo, Haiming Li, Donglin Yu

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18433 2025-10-22 cs.CV cs.AI cs.IR 57%

ImageGem: In-the-wild Generative Image Interaction Dataset for Generative Model Personalization

Yuanhe Guo, Linxi Xie, Zhuoran Chen, Kangrui Yu, Ryan Po, Guandao Yang, Gordon Wetztein, Hongyi Wen

机构 * NYU(纽约大学) Stanford(斯坦福大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18054 2025-10-22 cs.CV cs.CL 57%

HouseTour: A Virtual Real Estate A(I)gent

Ata Çelen, Marc Pollefeys, Daniel Barath, Iro Armeni

机构 * ETH Zürich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Microsoft Spatial AI Lab(微软空间人工智能实验室) HUN-REN SZTAKI(匈牙利-罗马尼亚科学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments Published on ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17626 2025-10-22 cs.CV cs.AI 57%

CaMiT: A Time-Aware Car Model Dataset for Classification and Generation

Frédéric LIN, Biruk Abere Ambaw, Adrian Popescu, Hejer Ammar, Romaric Audigier, Hervé Le Borgne

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,CEA,List)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

Comments To be published in NeurIPS 2025 Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17940 2025-10-22 cs.AI 57%

Beyond More Context: Retrieval Diversity Boosts Multi-Turn Intent Understanding

Zhiming Lin

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

Comments 15 pages,6 figs

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18873 2025-10-22 cs.CV 50%

DSI-Bench: A Benchmark for Dynamic Spatial Intelligence

Ziang Zhang, Zehan Wang, Guanghao Zhang, Weilong Dai, Yan Xia, Ziang Yan, Minjie Hong, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Shanghai AI Lab(上海人工智能实验室)

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18596 2025-10-22 cs.SE cs.CV 50%

CUARewardBench: A Benchmark for Evaluating Reward Models on Computer-using Agent

Haojia Lin, Xiaoyu Tan, Yulei Qin, Zihan Xu, Yuchen Shi, Zongyi Li, Gang Li, Shaofei Cai, Siqi Cai, Chaoyou Fu, Ke Li, Xing Sun

机构 * Youtu-Agent Team(YouTu-Agent团队)

专题命中 评测与基准 :language model(abstract)

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18509 2025-10-22 cs.SE 50%

VAPU: System for Autonomous Legacy Code Modernization

Valtteri Ala-Salmi, Zeeshan Rasheed, Abdul Malik Sami, Muhammad Waseem, Kai-Kristian Kemell, Jussi Rasku, Mika Saari, Pekka Abrahamsson

专题命中 评测与基准 :LLM(abstract)

Comments Table 13, figure 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18262 2025-10-22 cs.CV 50%

UWBench: A Comprehensive Vision-Language Benchmark for Underwater Understanding

Da Zhang, Chenggang Rong, Bingyu Li, Feiyu Wang, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI)、中国电信)

专题命中 评测与基准 :language model(abstract)

Comments We have released V1, which only reports the test results. Our work is still ongoing, and the next version will be coming soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21089 2025-10-22 cs.CV 50%

DisasterM3: A Remote Sensing Vision-Language Dataset for Disaster Damage Assessment and Response

Junjue Wang, Weihao Xuan, Heli Qi, Zhihao Liu, Kunyi Liu, Yuhan Wu, Hongruixuan Chen, Jian Song, Junshi Xia, Zhuo Zheng, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Waseda University(早稻田大学) Stony Brook University(石溪大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(abstract)

Comments A multi-hazard, multi-sensor, and multi-task vision-language dataset for global-scale disaster assessment and response

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02236 2025-10-22 cs.CV cs.MM cs.SD eess.AS 50%

3D Audio-Visual Segmentation

Artem Sokolov, Swapnil Bhosale, Xiatian Zhu

机构 * University of Surrey, UK(Surrey大学)

专题命中 评测与基准 :foundation model(abstract)

Comments Accepted at the NeurIPS 2024 Workshop on Audio Imagination; this version updates the project page link

详情

展开后加载摘要…

URL PDF HTML 收藏