arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-08 至 2025-09-08 共收录 150 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 40 篇

2509.04794 2025-09-08 cs.CL 83%

Personality as a Probe for LLM Evaluation: Method Trade-offs and Downstream Effects

Gunmay Handa, Zekun Wu, Adriano Koshiyama, Philip Treleaven

机构 * University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02544 2025-09-08 cs.CL 83%

Caution for the Environment: Multimodal LLM Agents are Susceptible to Environmental Distractions

Xinbei Ma, Yiting Wang, Yao Yao, Tongxin Yuan, Aston Zhang, Zhuosheng Zhang, Hai Zhao

机构 * School of Computer Science(计算机学院) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering(智能交互与认知工程重点实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Key Laboratory of Trusted Data Circulation and Governance in Web3(Web3可信数据流通与治理上海市重点实验室) GenAI, Meta(Meta GenAI)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04714 2025-09-08 cs.SI 82%

ThumbnailTruth: A Multi-Modal LLM Approach for Detecting Misleading YouTube Thumbnails Across Diverse Cultural Settings

Wajiha Naveed, Zartash Afzal Uzmi, Zafar Ayyub Qazi

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11987 2025-09-08 cs.AI cs.LG 81%

FutureX: An Advanced Live Benchmark for LLM Agents in Future Prediction

Zhiyuan Zeng, Jiashuo Liu, Siyuan Chen, Tianci He, Yali Liao, Yixiao Tian, Jinpeng Wang, Zaiyuan Wang, Yang Yang, Lingyue Yin, Mingren Yin, Zhenwei Zhu, Tianle Cai, Zehui Chen, Jiecao Chen, Yantao Du, Xiang Gao, Jiacheng Guo, Liang Hu, Jianpeng Jiao, Xiangsheng Li, Jingkai Liu, Shuang Ni, Zhoufutu Wen, Ge Zhang, Kaiyuan Zhang, Xin Zhou, Jose Blanchet, Xipeng Qiu, Mengdi Wang, Wenhao Huang

机构 * Fudan University(复旦大学) Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

Comments Technical report, 51 pages. Update the results

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05056 2025-09-08 cs.CL 79%

Masked Diffusion Language Models with Frequency-Informed Training

Despoina Kosmopoulou, Efthymios Georgiou, Vaggelis Dorovatas, Georgios Paraskevopoulos, Alexandros Potamianos

机构 * National Technical University of Athens(国家技术大学雅典) Archimedes RU, Athena RC(阿基米德RU,雅典RC) University of Bern(伯恩大学) Institute of Language and Signal Processing, Athena RC(语言与信号处理研究所,雅典RC)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04969 2025-09-08 cs.CL cs.LG 79%

Classification of kinetic-related injury in hospital triage data using NLP

Midhun Shyam, Jim Basilakis, Kieran Luken, Steven Thomas, John Crozier, Paul M. Middleton, X. Rosalind Wang

机构 * School of Computer, Data and Mathematical Sciences(计算机、数据与数学科学学院) South Western Emergency Research Institute(西南急诊研究机构) Ingham Institute of Applied Medical Research(ingham应用医学研究学院) Liverpool Hospital(利物浦医院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Accepted as a short paper for publishing at ADMA 2025 (https://adma2025.github.io), with Supplementary Material available at https://github.com/CRMDS/Kinetic-Injury-Triage

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19835 2025-09-08 cs.CL cs.AI 79%

ATHAR: A High-Quality and Diverse Dataset for Classical Arabic to English Translation

Mohammed Khalil, Mohammed Sabry

机构 * ADAPT/DCU(ADAPT/都柏林大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments ArabicNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05297 2025-09-08 cs.CV 78%

FlowSeek: Optical Flow Made Easier with Depth Foundation Models and Motion Bases

Matteo Poggi, Fabio Tosi

机构 * Department of Computer Science and Engineering (DISI)(计算机科学与工程系) Advanced Research Center on Electronic System (ARCES)(电子系统高级研究中心) University of Bologna(博洛尼亚大学)

专题命中 评测与基准 :foundation model(title,abstract)

Comments ICCV 2025 - Project Page: https://flowseek25.github.io/ - Code: https://github.com/mattpoggi/flowseek

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04887 2025-09-08 cs.CY 78%

RINSER: Accurate API Prediction Using Masked Language Models

Muhammad Ejaz Ahmed, Christopher Cody, Muhammad Ikram, Sean Lamont, Alsharif Abuadbba, Seyit Camtepe, Surya Nepal, Muhammad Ali Kaafar

专题命中 评测与基准 :language model(title,abstract)

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00096 2025-09-08 physics.chem-ph cond-mat.mtrl-sci 78%

A foundation model for atomistic materials chemistry

Ilyes Batatia, Philipp Benner, Yuan Chiang, Alin M. Elena, Dávid P. Kovács, Janosh Riebesell, Xavier R. Advincula, Mark Asta, Matthew Avaylon, William J. Baldwin, Fabian Berger, Noam Bernstein, Arghya Bhowmik, Filippo Bigi, Samuel M. Blau, Vlad Cărare, Michele Ceriotti, Sanggyu Chong, James P. Darby, Sandip De, Flaviano Della Pia, Volker L. Deringer, Rokas Elijošius, Zakariya El-Machachi, Fabio Falcioni, Edvin Fako, Andrea C. Ferrari, John L. A. Gardner, Mikolaj J. Gawkowski, Annalena Genreith-Schriever, Janine George, Rhys E. A. Goodall, Jonas Grandel, Clare P. Grey, Petr Grigorev, Shuang Han, Will Handley, Hendrik H. Heenen, Kersti Hermansson, Christian Holm, Cheuk Hin Ho, Stephan Hofmann, Jad Jaafar, Konstantin S. Jakob, Hyunwook Jung, Venkat Kapil, Aaron D. Kaplan, Nima Karimitari, James R. Kermode, Panagiotis Kourtis, Namu Kroupa, Jolla Kullgren, Matthew C. Kuner, Domantas Kuryla, Guoda Liepuoniute, Chen Lin, Johannes T. Margraf, Ioan-Bogdan Magdău, Angelos Michaelides, J. Harry Moore, Aakash A. Naik, Samuel P. Niblett, Sam Walton Norwood, Niamh O'Neill, Christoph Ortner, Kristin A. Persson, Karsten Reuter, Andrew S. Rosen, Louise A. M. Rosset, Lars L. Schaaf, Christoph Schran, Benjamin X. Shi, Eric Sivonxay, Tamás K. Stenczel, Viktor Svahn, Christopher Sutton, Thomas D. Swinburne, Jules Tilly, Cas van der Oord, Santiago Vargas, Eszter Varga-Umbrich, Tejs Vegge, Martin Vondrák, Yangshuai Wang, William C. Witt, Thomas Wolf, Fabian Zills, Gábor Csányi

专题命中 评测与基准 :foundation model(title,abstract)

Comments 154 pages, 83 figures, 80MB PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16172 2025-09-08 cs.AI 77%

Graph RAG as Human Choice Model: Building a Data-Driven Mobility Agent with Preference Chain

Kai Hu, Parfait Atchade-Adelomou, Carlo Adornetto, Adrian Mora-Carrero, Luis Alonso-Pastor, Ariel Noyman, Yubo Liu, Kent Larson

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08613 2025-09-08 cs.CL 77%

Assessing the Sensitivity and Alignment of FOL Closeness Metrics

Ramya Keerthy Thatikonda, Wray Buntine, Ehsan Shareghi

机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,莫纳什大学) College of Engineering and Computer Science, VinUniversity(工程与计算机科学学院,文大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04461 2025-09-08 cs.CL cs.SI 77%

From Post To Personality: Harnessing LLMs for MBTI Prediction in Social Media

Tian Ma, Kaiyu Feng, Yu Rong, Kangfei Zhao

机构 * Beijing Institute of Technology(北京理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Journal ref CIKM 2025 Short Paper (Technical Report)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04483 2025-09-08 cs.CL cs.AI 76%

DecMetrics: Structured Claim Decomposition Scoring for Factually Consistent LLM Outputs

Minghui Huang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20938 2025-09-08 cs.DC 75%

ParEval-Repo: A Benchmark Suite for Evaluating LLMs with Repository-level HPC Translation Tasks

Joshua H. Davis, Daniel Nichols, Ishan Khillan, Abhinav Bhatele

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20201 2025-09-08 cs.CL 74%

Social Bias in Multilingual Language Models: A Survey

Lance Calvin Lim Gamboa, Yue Feng, Mark Lee

机构 * School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院) Department of Information Systems and Computer Science, Ateneo de Manila University(马尼拉大学信息系统与计算机科学系)

专题命中 评测与基准 :language model(title);分类 cs.CL

Comments Accepted into EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04908 2025-09-08 cs.AI cs.CL cs.CV cs.HC 73%

SparkUI-Parser: Enhancing GUI Perception with Robust Grounding and Parsing

Hongyi Jing, Jiafu Chen, Chen Rao, Ziqiang Dang, Jiajie Teng, Tianyi Chu, Juncheng Mo, Shuo Fang, Huaizhong Lin, Rui Lv, Chenguang Ma, Lei Zhao

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04460 2025-09-08 cs.CL cs.AI 73%

CoCoNUTS: Concentrating on Content while Neglecting Uninformative Textual Styles for AI-Generated Peer Review Detection

Yihan Chen, Jiawei Chen, Guozhao Mo, Xuanang Chen, Ben He, Xianpei Han, Le Sun

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04796 2025-09-08 cs.CL 70%

Knowledge Collapse in LLMs: When Fluency Survives but Facts Fail under Recursive Synthetic Training

Figarri Keisha, Zekun Wu, Ze Wang, Adriano Koshiyama, Philip Treleaven

机构 * Holistic AI University College London(伦敦大学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04757 2025-09-08 cs.CV cs.AI 70%

MCANet: A Multi-Scale Class-Specific Attention Network for Multi-Label Post-Hurricane Damage Assessment using UAV Imagery

Zhangding Liu, Neda Mohammadi, John E. Taylor

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 34 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04456 2025-09-08 cs.CL 70%

Mentalic Net: Development of RAG-based Conversational AI and Evaluation Framework for Mental Health Support

Anandi Dutta, Shivani Mruthyunjaya, Jessica Saddington, Kazi Sifatul Islam

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Preprint Version, Accepted in ISEMV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21445 2025-09-08 cs.CL cs.IR 70%

Text2Cypher Across Languages: Evaluating and Finetuning LLMs

Makbule Gulcin Ozsoy, William Tai

机构 * Neo4j

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18416 2025-09-08 cs.CL cs.AI cs.LG 67%

PersonaGym: Evaluating Persona Agents and LLMs

Vinay Samuel, Henry Peng Zou, Yue Zhou, Shreyas Chaudhari, Ashwin Kalyan, Tanmay Rajpurohit, Ameet Deshpande, Karthik Narasimhan, Vishvak Murahari

机构 * University of Maryland, College Park(马里兰大学 College Park分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Georgia Tech(佐治亚理工学院) Princeton University(普林斯顿大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10375 2025-09-08 cs.SE 67%

Mokav: Execution-driven Differential Testing with LLMs

Khashayar Etemadi, Bardia Mohammadi, Zhendong Su, Martin Monperrus

专题命中 评测与基准 :LLM(abstract);prompting(abstract)

Journal ref Journal of Systems and Software, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04499 2025-09-08 cs.CL cs.AI 62%

DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence

Pranav Narayanan Venkit, Philippe Laban, Yilun Zhou, Kung-Hsiang Huang, Yixin Mao, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

Comments arXiv admin note: text overlap with arXiv:2410.22349

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19964 2025-09-08 cs.LG 61%

Do Sparse Autoencoders Generalize? A Case Study of Answerability

Lovis Heindrich, Philip Torr, Fazl Barez, Veronika Thost

机构 * University of Oxford(牛津大学) University of Oxford, Oxford, United Kingdom(牛津大学) MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.LG;foundation model(comments)

Comments Accepted workshop paper at the ICML 2025 Workshop on Reliable and Responsible Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15862 2025-09-08 cs.LG cs.CY 57%

Quantifying Holistic Review: A Multi-Modal Approach to College Admissions Prediction

Jun-Wei Zeng, Jerry Shen

机构 * Vanke Meisha Academy(万科梅沙书院)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04376 2025-09-08 cs.CV 50%

AnomalyLMM: Bridging Generative Knowledge and Discriminative Retrieval for Text-Based Person Anomaly Search

Hao Ju, Hu Zhang, Zhedong Zheng

机构 * Faculty of Science and Technology and Institute of Collaborative Innovation, University of Macau(科技学院和协同创新研究所,澳门大学) CSIRO Data61(CSIRO数据61)

专题命中 评测与基准 :prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04091 2025-09-08 cs.CR 50%

Revisiting Third-Party Library Detection: A Ground Truth Dataset and Its Implications Across Security Tasks

Jintao Gu, Haolang Lu, Guoshun Nan, Yihan Lin, Kun Wang, Yuchun Guo, Yigui Cao, Yang Liu

专题命中 评测与基准 :LLM(abstract)

Comments 20pages, 7figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 15 篇

2509.04606 2025-09-08 cs.CL cs.AI cs.CV 91%

Sample-efficient Integration of New Modalities into Large Language Models

Osman Batur İnce, André F. T. Martins, Oisin Mac Aodha, Edoardo M. Ponti

机构 * University of Edinburgh(爱丁堡大学) Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术学院) Unbabel

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏