arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-02 至 2025-10-02 共收录 192 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 45 篇

2404.11726 2025-10-02 cs.CL 79%

Investigating Gender Bias in Turkish Language Models

Orhun Mersin Caglidil, Malte Ostendorff, Georg Rehm

机构 * German Research Center for Artificial Intelligence (DFKI) Berlin, Germany(德国人工智能研究中心(DFKI)柏林)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments arXiv admin note: text overlap with arXiv:1903.10561 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00311 2025-10-02 cs.CL 79%

CORTEX: Collaborative LLM Agents for High-Stakes Alert Triage

Bowen Wei, Yuan Shen Tay, Howard Liu, Jinhao Pan, Kun Luo, Ziwei Zhu, Chris Jordan

机构 * George Mason University(乔治·马歇尔大学) Fluency Security(流畅安全)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00694 2025-10-02 cs.CL cs.AI cs.IR 79%

ALARB: An Arabic Legal Argument Reasoning Benchmark

Harethah Abu Shairah, Somayah AlHarbi, Abdulaziz AlHussein, Sameer Alsabea, Omar Shaqaqi, Hebah AlShamlan, Omar Knio, George Turkiyyah

机构 * King Abdullah University of Science and Technology(卡塔尔国王阿卜杜勒阿齐兹科学与技术大学) THIQAH

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

Comments Accepted paper at ArabicNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00561 2025-10-02 cs.CV 78%

Assessing Foundation Models for Mold Colony Detection with Limited Training Data

Henrik Pichler, Janis Keuper, Matthew Copping

机构 * Offenburg University of Applied Sciences(奥芬堡应用科学大学) BioStates GmbH(BioStates公司)

专题命中 评测与基准 :foundation model(title,abstract)

Comments 17 pages, 2 figures, accepted as oral presentation at GCPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00414 2025-10-02 cs.HC 78%

RELATE-Sim: Leveraging Turning Point Theory and LLM Agents to Predict and Understand Long-Term Relationship Dynamics through Interactive Narrative Simulations

Matthew Yue, Zhikun Xu, Vivek Gupta, Thao Ha, Liesal Sharabi, Ben Zhou

专题命中 评测与基准 :LLM(title,abstract)

Comments 10 pages, 3 figures, Submitted to CHI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09746 2025-10-02 cs.SD eess.AS 78%

Deep Learning for Tuberculosis Screening in a High-burden Setting using Cough Analysis and Speech Foundation Models

Ning Ma, Bahman Mirheidari, Guy J. Brown, Nsala Sanjase, Minyoi M. Maimbolwa, Solomon Chifwamba, Seke Muzazu, Monde Muyoyeta, Mary Kagujje

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Centre for Infectious Disease Research in Zambia(赞比亚传染病疾病研究中心)

专题命中 评测与基准 :foundation model(title,abstract)

Comments submitted to IEEE Journal of Biomedical and Health Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25868 2025-10-02 cs.CL 77%

ReFACT: A Benchmark for Scientific Confabulation Detection with Positional Error Annotations

Yindong Wang, Martin Preiß, Margarita Bugueño, Jan Vincent Hoffbauer, Abdullatif Ghajar, Tolga Buz, Gerard de Melo

机构 * Hasso Plattner Institute / University of Potsdam, Germany(霍普夫纳研究所 / 潘托姆大学,德国)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00339 2025-10-02 cs.HC cs.AI cs.CL cs.LG 75%

Navigating the Synchrony-Stability Frontier in Adaptive Chatbots

T. James Brandt

机构 * University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments pages; 9 tables; 7 figures; code & analysis artifact: https://doi.org/10.5281/zenodo.17238269; under review at ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13324 2025-10-02 cs.HC 75%

Designing Psychometric Bias Measures for ChatBots: An Application to Racial Bias Measurement

Mouhacine Benosman

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00908 2025-10-02 cs.IR cs.AI cs.CL 73%

Bridging Language Gaps: Advances in Cross-Lingual Information Retrieval with Multilingual LLMs

Roksana Goworek, Olivia Macmillan-Scott, Eda B. Özyiğit

机构 * The Alan Turing Institute(艾伦·图灵研究所) Queen Mary University of London(伦敦女王学院) University College London(伦敦大学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00691 2025-10-02 cs.CL cs.AI 73%

Inclusive Easy-to-Read Generation for Individuals with Cognitive Impairments

François Ledoyen, Gaël Dias, Alexis Lechervy, Jeremie Pantin, Fabrice Maurel, Youssef Chahir, Elisa Gouzonnat, Mélanie Berthelot, Stanislas Moravac, Armony Altinier, Amy Khairalla

机构 * Université Caen Normandie, ENSICAEN, CNRS, Normandie Univ, GREYC UMR 6072, F-14000 Caen, France(法国卡恩-诺曼底大学、ENSICAEN、法国国家科学研究中心、诺曼底大学、GREYC UMR 6072)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00639 2025-10-02 cs.SD 71%

Reference-free automatic speech severity evaluation using acoustic unit language modelling

Bence Mark Halpern, Tomoki Toda

机构 * Nagoya University(名古屋大学)

专题命中 评测与基准 :language model(title)

Comments 5 pages. Proceedings of the 6th ACM International Conference on Multimedia in Asia Workshops

Journal ref In Proceedings of the 6th ACM International Conference on Multimedia in Asia Workshops (pp. 1-5) (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06589 2025-10-02 cs.CL 70%

Precise Information Control in Long-Form Text Generation

Jacqueline He, Howard Yen, Margaret Li, Shuyue Stella Li, Zhiyuan Zeng, Weijia Shi, Yulia Tsvetkov, Danqi Chen, Pang Wei Koh, Luke Zettlemoyer

机构 * Paul G. Allen School of Computing Science & Engineering, University of Washington(保罗·G·艾伦计算科学与工程学院,华盛顿大学) Princeton Language and Intelligence (PLI), Princeton University(普林斯顿语言与智能(PLI),普林斯顿大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 评测与基准 :language model(abstract);post-training(abstract);分类 cs.CL

Comments NeurIPS 2025. 66 pages, 8 figures. Code is at https://github.com/jacqueline-he/precise-information-control

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00946 2025-10-02 cs.SE 67%

ChatGPT in Introductory Programming: Counterbalanced Evaluation of Code Quality, Conceptual Learning, and Student Perceptions

Shiza Andleeb, Brandon Kantorski, Jeffrey C. Carver

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Accepted to SIGCITE'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00932 2025-10-02 cs.PF 67%

Opal: A Modular Framework for Optimizing Performance using Analytics and LLMs

Mohammad Zaeed, Tanzima Z. Islam, Vladimir Inđić

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments 12 pages and 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00783 2025-10-02 cs.RO 67%

Semantic Visual Simultaneous Localization and Mapping: A Survey on State of the Art, Challenges, and Future Directions

Thanh Nguyen Canh, Haolan Zhang, Xiem HoangVan, Nak Young Chong

机构 * School of Information Science, Japan Advanced Institute of Science and Technology(信息科学学院,日本科学技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00776 2025-10-02 cond-mat.mtrl-sci 67%

Material Synthesis 2025 (MatSyn25) Dataset for 2D Materials

Chengbo Li, Ying Wang, Qianying Wang, Zhizhi Tan, Haiqing Jia, Yi Liu, Li Qian, Nian Ran, Jianjun Liu, Zhixiong Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00603 2025-10-02 cs.CV 67%

LVLMs as inspectors: an agentic framework for category-level structural defect annotation

Sheng Jiang, Yuanmin Ning, Bingxi Huang, Peiyin Chen, Zhaohui Chen

专题命中 评测与基准 :language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00069 2025-10-02 cs.CV 67%

OIG-Bench: A Multi-Agent Annotated Benchmark for Multimodal One-Image Guides Understanding

Jiancong Xie, Wenjin Wang, Zhuomeng Zhang, Zihan Liu, Qi Liu, Ke Feng, Zixun Sun, Yuedong Yang

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Interactive Entertainment Group, Tencent Inc, China(腾讯互动娱乐集团) Key Laboratory of Machine Intelligence and Advanced Computing (MOE), China(机器智能与先进计算重点实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01174 2025-10-02 cs.CV cs.AI cs.CL cs.HC cs.MM 62%

Code2Video: A Code-centric Paradigm for Educational Video Generation

Yanzhe Chen, Kevin Qinghong Lin, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(Show实验室,新加坡国立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

Comments Project Page: https://showlab.github.io/Code2Video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00288 2025-10-02 cs.CL cs.AI 62%

o-MEGA: Optimized Methods for Explanation Generation and Analysis

Ľuboš Kriš, Jaroslav Kopčan, Qiwei Peng, Andrej Ridzik, Marcel Veselý, Martin Tamajka

机构 * Kempelen Institute of Intelligent Technologies(基姆佩尔智能技术研究所) University of Copenhagen(哥本哈根大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00255 2025-10-02 cs.CL cs.AI 62%

TASER: Translation Assessment via Systematic Evaluation and Reasoning

Monishwaran Maheswaran, Marco Carini, Christian Federmann, Tony Diaz

机构 * University of California, Berkeley(加州大学伯克利分校) Apple Inc.(苹果公司)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00001 2025-10-02 cs.LG cs.AI cs.SE 62%

Methodological Framework for Quantifying Semantic Test Coverage in RAG Systems

Noah Broestl, Adel Nasser Abdalla, Rajprakash Bale, Hersh Gupta, Max Struever

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

Comments 7 pages, 3 figures, 1 table, 1 algo

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22646 2025-10-02 cs.CV cs.AI cs.CL 62%

Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs

Xingyu Fu, Siyi Liu, Yinuo Xu, Pan Lu, Guangqiuse Hu, Tianbo Yang, Taran Anantasagar, Christopher Shen, Yikai Mao, Yuanzhe Liu, Keyush Shah, Chung Un Lee, Yejin Choi, James Zou, Dan Roth, Chris Callison-Burch

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

Comments Project Page: https://deeptracereward.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09167 2025-10-02 eess.SP cs.AI q-bio.QM 57%

Estimating Visceral Adiposity from Wrist-Worn Accelerometry

James R. Williamson, Andrew Alini, Brian A. Telfer, Adam W. Potter, Karl E. Friedl

机构 * Massachusetts Institute of Technology(麻省理工学院) Lincoln Laboratory(林肯实验室) U.S. Army Research Institute of Environmental Medicine(美国陆军环境医学研究所)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

Comments This article has been accepted for publication in IEEE Journal of Biomedical and Health Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00931 2025-10-02 cs.CL 57%

Making, not Taking, the Best of N

Ammar Khairi, Daniel D'souza, Marzieh Fadaee, Julia Kreutzer

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00174 2025-10-02 cs.CL 57%

PrimeX: A Dataset of Worldview, Opinion, and Explanation

Rik Koncel-Kedziorski, Brihi Joshi, Tim Paek

机构 * Apple(苹果公司) University of Southern California(南加州大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00806 2025-10-02 cs.CV 50%

From Seeing to Predicting: A Vision-Language Framework for Trajectory Forecasting and Controlled Video Generation

Fan Yang, Zhiyang Chen, Yousong Zhu, Xin Li, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心、自动化研究所、中国科学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室、深圳中国) School of Artificial Intelligence, University of Chinese Academy of Science, Beijing, China(人工智能学院、中国科学院大学、北京中国) Wuhan AI Research, Wuhan, China(武汉人工智能研究、武汉中国) MAPLE Lab, Westlake University(MAPLE实验室、西湖大学)

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00483 2025-10-02 cs.CV 50%

MathSticks: A Benchmark for Visual Symbolic Compositional Reasoning with Matchstick Puzzles

Yuheng Ji, Huajie Tan, Cheng Chi, Yijie Xu, Yuting Zhao, Enshen Zhou, Huaihai Lyu, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang, Xiaolong Zheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Peking University(北京大学) The University of Sydney(悉尼大学) Beihang University(北航大学)

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26006 2025-10-02 cs.CV 50%

AgenticIQA: An Agentic Framework for Adaptive and Interpretable Image Quality Assessment

Hanwei Zhu, Yu Tian, Keyan Ding, Baoliang Chen, Bolin Chen, Shiqi Wang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学) Nanjing University of Information Science and Technology(南京信息工程大学) Zhejiang University(浙江大学) South China Normal University(华南师范大学) Alibaba DAMO Academy(阿里巴巴达摩院) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏