arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-21 至 2025-10-21 共收录 356 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 74 篇

2411.10213 2025-10-21 cs.SE cs.AI 85%

An Empirical Study on LLM-based Agents for Automated Bug Fixing

Xiangxin Meng, Zexiong Ma, Pengfei Gao, Chao Peng

机构 * ByteDance(字节跳动)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16081 2025-10-21 cs.CY cs.AI 85%

SARHAchat: An LLM-Based Chatbot for Sexual and Reproductive Health Counseling

Jiaye Yang, Xinyu Zhao, Tianlong Chen, Kandyce Brennan

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15961 2025-10-21 cs.LG cs.AI cs.CY 84%

Interpretable Graph-Language Modeling for Detecting Youth Illicit Drug Use

Yiyang Li, Zehong Wang, Zhengqing Yuan, Zheyuan Zhang, Keerthiram Murugesan, Chuxu Zhang, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) IBM Research(IBM研究院) University of Connecticut(康涅狄格大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12575 2025-10-21 cs.AI 83%

RealMath: A Continuous Benchmark for Evaluating Language Models on Research-Level Mathematics

Jie Zhang, Cezara Petrui, Kristina Nikolić, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17052 2025-10-21 cs.AI 81%

ToolCritic: Detecting and Correcting Tool-Use Errors in Dialogue Systems

Hassan Hamad, Yingru Xu, Liang Zhao, Wenbo Yan, Narendra Gyanchandani

机构 * Amazon(亚马逊)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15891 2025-10-21 cs.HC cs.AI cs.CL cs.LG 80%

Detecting and Preventing Harmful Behaviors in AI Companions: Development and Evaluation of the SHIELD Supervisory System

Ziv Ben-Zion, Paul Raffelhüschen, Max Zettl, Antonia Lüönd, Achim Burrer, Philipp Homan, Tobias R Spiller

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17172 2025-10-21 cs.AI 79%

Combining ECG Foundation Model and XGBoost to Predict In-Hospital Malignant Ventricular Arrhythmias in AMI Patients

Shun Huang, Wenlu Xing, Shijia Geng, Hailong Wang, Guangkun Nie, Gongzheng Tang, Chenyang He, Shenda Hong

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17389 2025-10-21 cs.CL cs.AI 79%

EduAdapt: A Question Answer Benchmark Dataset for Evaluating Grade-Level Adaptability in LLMs

Numaan Naeem, Abdellah El Mekki, Muhammad Abdul-Mageed

机构 * MBZUAI The University of British Columbia(不列颠哥伦比亚大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments 28 pages, 2 figures, 14 tables, 50 listings, EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18601 2025-10-21 cs.CL cs.AI 79%

Flex-Judge: Text-Only Reasoning Unleashes Zero-Shot Multimodal Evaluators

Jongwoo Ko, Sungnyun Kim, Sungwoo Cho, Se-Young Yun

机构 * Microsoft(微软公司) KAIST AI(韩国科学技术院人工智能研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16373 2025-10-21 cs.CL cs.AI 79%

Navigating through the hidden embedding space: steering LLMs to improve mental health assessment

Federico Ravenda, Seyed Ali Bahrainian, Andrea Raballo, Antonietta Mira

机构 * University of Tuebingen(图宾根大学) Insubria University(因斯布里亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15872 2025-10-21 cs.AR cs.AI cs.LG 79%

Multimodal Chip Physical Design Engineer Assistant

Yun-Da Tsai, Chang-Yu Chao, Liang-Yeh Shen, Tsung-Han Lin, Haoyu Yang, Mark Ho, Yi-Chen Lu, Wen-Hao Liu, Shou-De Lin, Haoxing Ren

机构 * National Taiwan University(国立台湾大学) NVIDIA Research(NVIDIA研究)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14351 2025-10-21 cs.CL cs.AI 79%

Beyond One World: Benchmarking Super Heros in Role-Playing Across Multiversal Contexts

Perapard Ngokpol, Kun Kerdthaisong, Pasin Buakhaw, Pitikorn Khlaisamniang, Supasate Vorathammathorn, Piyalitt Ittichaiwong, Nutchanon Yongsatianchot

机构 * Faculty of Engineering, Thammasat School of Engineering, Thammasat University(工程学院,泰国朱拉安高校工程学院,泰国朱拉安大学) Department of Computer Engineering and Digital Technology, Faculty of Engineering, Chulalongkorn University(计算机工程与数字技术系,工程学院,朱拉安大学) Artificial Intelligence Association of Thailand(泰国人工智能协会) School of Biomedical Engineering & Imaging Sciences, King’s College London(生物医学工程与成像科学学院,伦敦国王学院) Siriraj Informatics and Data Innovation Center (SIData+), Faculty of Medicine, Siriraj Hospital, Mahidol University(Siriraj信息与数据创新中心(SIData+),医学学院,Siriraj医院,玛希道大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00643 2025-10-21 cs.CL cs.AI 79%

SATA-BENCH: Select All That Apply Benchmark for Multiple Choice Questions

Weijie Xu, Shixian Cui, Xi Fang, Chi Xue, Stephanie Eckman, Chandan K. Reddy

机构 * Amazon(亚马逊)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 40 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16538 2025-10-21 cs.CV cs.RO 78%

Leveraging Vision-Language Models for Open-Vocabulary Instance Segmentation and Tracking

Bastian Pätzold, Jan Nogga, Sven Behnke

机构 * Autonomous Intelligent Systems, University of Bonn(博恩大学自主智能系统中心) Lamarr Institute for Machine Learning and AI(拉马尔人工智能与机器学习研究所) Center for Robotics, University of Bonn(博恩大学机器人中心)

专题命中 评测与基准 :language model(title,abstract)

Comments IEEE Robotics and Automation Letters (RA-L), November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16641 2025-10-21 cs.CV 78%

MultiVerse: A Multi-Turn Conversation Benchmark for Evaluating Large Vision and Language Models

Young-Jun Lee, Byung-Kwan Lee, Jianshu Zhang, Yechan Hwang, Byungsoo Ko, Han-Gyu Kim, Dongyu Yao, Xuankun Rong, Eojin Joo, Seung-Ho Han, Bowon Ko, Ho-Jin Choi

机构 * KAIST(韩国科学技术院) WHU(华中科技大学) NAVER CMU(卡内基梅隆大学)

专题命中 评测与基准 :language model(title,abstract)

Comments Project website: https://passing2961.github.io/multiverse-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16147 2025-10-21 cs.GR 78%

Procedural Scene Programs for Open-Universe Scene Generation: LLM-Free Error Correction via Program Search

Maxim Gumin, Do Heon Han, Seung Jean Yoo, Aditya Ganeshan, R. Kenny Jones, Kailiang Fu, Rio Aguina-Kang, Stewart Morris, Daniel Ritchie

专题命中 评测与基准 :LLM(title,abstract)

Comments To appear in SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15682 2025-10-21 cs.CV 78%

ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval

Guanqi Zhan, Yuanpei Liu, Kai Han, Weidi Xie, Andrew Zisserman

机构 * VGG, University of Oxford(牛津大学视觉几何组) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :foundation model(title);language model(abstract)

Comments Accepted by CBMI 2025 (IEEE International Conference on Content-Based Multimedia Indexing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12943 2025-10-21 cs.CL 77%

The Curious Case of Curiosity across Human Cultures and LLMs

Angana Borah, Zhijing Jin, Rada Mihalcea

机构 * University of Michigan - Ann Arbor(密歇根大学安阿伯分校) University of Toronto(多伦多大学) Vector Institute(向量研究所) MPI for Intelligent Systems, Tubingen, Germany(图宾根德国智能系统研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Preprint (Paper under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16470 2025-10-21 cs.DB cs.AI cs.SE 77%

Declarative Techniques for NL Queries over Heterogeneous Data

Elham Khabiri, Jeffrey O. Kephart, Fenno F. Heath, Srideepika Jayaraman, Fateh A. Tipu, Yingjie Li, Dhruv Shah, Achille Fokoue, Anu Bhamidipaty

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16085 2025-10-21 cs.CY cs.AI 77%

MoPHES:Leveraging on-device LLMs as Agent for Mobile Psychological Health Evaluation and Support

Xun Wei, Pukai Zhou, Zeyu Wang

机构 * School of Software Engineering, Jiangxi University of Science and Technology(江西科技理工大学软件工程学院) School of Computer Science, Shenzhen University(深圳大学计算机科学学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14180 2025-10-21 cs.IR cs.LG 77%

RewardRank: Optimizing True Learning-to-Rank Utility

Gaurav Bhatt, Kiran Koshy Thekumparampil, Tanmay Gangwani, Tesi Xiao, Leonid Sigal

机构 * The University of British Columbia(不列颠哥伦比亚大学) Amazon(亚马逊) The Vector Institute, Canada(加拿大向量研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11582 2025-10-21 cs.CL 77%

Subjective Evaluation Profile Analysis of Science Fiction Short Stories and its Critical-Theoretical Significance

Kazuyoshi Otsuka

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

Comments 38 pages. Manuscript submitted for review to the Journal of Computational Literary Studies (JCLS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17455 2025-10-21 cs.CL cs.AI 76%

Towards Evaluating Proactive Risk Awareness of Multimodal Language Models

Youliang Yuan, Wenxiang Jiao, Yuejin Xie, Chihao Shen, Menghan Tian, Wenxuan Wang, Jen-tse Huang, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Xiaohongshu Inc.(小红书公司) Renmin University of China(中国人民大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025 (Track on Datasets and Benchmarks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17132 2025-10-21 cs.LG cs.AI cs.CL 75%

Do LLMs Recognize Your Latent Preferences? A Benchmark for Latent Information Discovery in Personalized Interaction

Ioannis Tsaknakis, Bingqing Song, Shuyu Gan, Dongyeop Kang, Alfredo Garcia, Gaowen Liu, Charles Fleming, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Texas A&M University(德克萨斯农工大学) CISCO Research(思科研究)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17023 2025-10-21 cs.CV cs.MM 75%

Enrich and Detect: Video Temporal Grounding with Multimodal LLMs

Shraman Pramanick, Effrosyni Mavroudi, Yale Song, Rama Chellappa, Lorenzo Torresani, Triantafyllos Afouras

机构 * FAIR, Meta(FAIR、Meta) Johns Hopkins University(约翰霍普金斯大学) Northeastern University(东北大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments ICCV 2025 (Highlights)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10407 2025-10-21 cs.CR cs.SE 75%

PrediQL: Automated Testing of GraphQL APIs with LLMs

Shaolun Liu, Sina Marefat, Omar Tsai, Yu Chen, Zecheng Deng, Jia Wang, Mohammad A. Tayebi

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 8 pages, two columns

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13681 2025-10-21 cs.SE cs.AI cs.CL cs.LG 75%

Repo2Run: Automated Building Executable Environment for Code Repository at Scale

Ruida Hu, Chao Peng, Xinchen Wang, Junjielong Xu, Cuiyun Gao

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ByteDance, Beijing(字节跳动)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16573 2025-10-21 cs.CL cs.AI cs.LG 75%

AI-Generated Text Detection in Low-Resource Languages: A Case Study on Urdu

Muhammad Ammar, Hadiya Murad Hadi, Usman Majeed Butt

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14980 2025-10-21 cs.AI cs.CL cs.CV cs.GR cs.LG 75%

Agentic Design of Compositional Machines

Wenqian Zhang, Weiyang Liu, Zhen Liu

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 75 pages, 31 figures, Project Page: https://besiegefield.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17263 2025-10-21 cs.CL 74%

TaxoAlign: Scholarly Taxonomy Generation Using Language Models

Avishek Lahiri, Yufang Hou, Debarshi Kumar Sanyal

机构 * Indian Association for the Cultivation of Science(印度科学培养协会) IT:U Interdisciplinary Transformation University Austria(奥地利 interdisciplinary Transformation University)

专题命中 评测与基准 :language model(title);分类 cs.CL

Comments This paper has been accepted at the EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏