arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-07 至 2025-10-07 共收录 382 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 82 篇

2510.03902 2025-10-07 cs.SE 75%

Multi-Agent Code-Orchestrated Generation for Reliable Infrastructure-as-Code

Rana Nameer Hussain Khan, Dawood Wasif, Jin-Hee Cho, Ali Butt

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03588 2025-10-07 cs.SE cs.MA 75%

REFINE: Enhancing Program Repair Agents through Context-Aware Patch Refinement

Anvith Pabba, Simin Chen, Alex Mathai, Anindya Chakraborty, Baishakhi Ray

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments We also open source our code at https://anonymous.4open.science/r/SemAgent-7B2F/README.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03120 2025-10-07 cs.CL 74%

SurveyBench: Can LLM(-Agents) Write Academic Surveys that Align with Reader Needs?

Zhaojun Sun, Xuzhou Zhu, Xuanhe Zhou, Xin Tong, Shuo Wang, Jie Fu, Guoliang Li, Zhiyuan Liu, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(title);分类 cs.CL

Comments Visit our code repository at: https://github.com/weAIDB/SurveyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04320 2025-10-07 cs.CL cs.LG 73%

Read the Scene, Not the Script: Outcome-Aware Safety for LLMs

Rui Wu, Yihao Quan, Zeru Shi, Zhenting Wang, Yanshu Li, Ruixiang Tang

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04557 2025-10-07 cs.CL cs.AI 73%

SSA-COMET: Do LLMs Outperform Learned Metrics in Evaluating MT for Under-Resourced African Languages?

Senyu Li, Jiayi Wang, Felermino D. M. A. Ali, Colin Cherry, Daniel Deutsch, Eleftheria Briakou, Rui Sousa-Silva, Henrique Lopes Cardoso, Pontus Stenetorp, David Ifeoluwa Adelani

机构 * Mila - Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) University College London(伦敦大学学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Google(谷歌) LLMC, National Institute of Informatics(LLMC,信息研究院) LIACC, Faculdade de Engenharia, Universidade do Porto(LIACC,工程学院,葡萄牙大学) CLUP, Faculdade de Letras, Universidade do Porto(CLUP,文学学院,葡萄牙大学)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03102 2025-10-07 cs.CL 70%

Semantic Similarity in Radiology Reports via LLMs and NER

Beth Pearson, Ahmed Adnan, Zahraa S. Abdallah

机构 * University of Bristol(布里斯托大学) Rosenfield Health Tech Ltd(罗森菲尔德健康科技有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12230 2025-10-07 cs.CV cs.AI cs.RO 70%

LIAM: Multimodal Transformer for Language Instructions, Images, Actions and Semantic Maps

Yihao Wang, Raphael Memmesheimer, Sven Behnke

机构 * Autonomous Intelligent Systems, Computer Science Institute VI, Center for Robotics, University of Bonn, Germany(自主智能系统,计算机科学研究所第六研究所,机器人中心,波恩大学,德国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 12 pages, 4 figures, 2 tables, 19th International Conference on Intelligent Autonomous Systems (IAS), Genoa, Italy, June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04257 2025-10-07 cs.CR cs.AI 70%

AgentTypo: Adaptive Typographic Prompt Injection Attacks against Black-box Multimodal Agents

Yanjie Li, Yiming Cao, Dong Wang, Bin Xiao

机构 * Computing Department of Hong Kong Polytechnic University(香港理工大学计算机系) Computing Department, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

Comments 13 pages, 8 figures. Submitted to IEEE Transactions on Information Forensics & Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03921 2025-10-07 cs.CV cs.AI cs.HC 70%

Talking Tennis: Language Feedback from 3D Biomechanical Action Recognition

Arushi Dashore, Aryan Anumala, Emily Hui, Olivia Yang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 10 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03914 2025-10-07 cs.SE cs.AI 70%

Refactoring with LLMs: Bridging Human Expertise and Machine Understanding

Yonnel Chen Kuang Piao, Jean Carlors Paul, Leuson Da Silva, Arghavan Moradi Dakhel, Mohammad Hamdaqa, Foutse Khomh

机构 * Department of Computer Engineering and Software Engineering(计算机工程与软件工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 43 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03700 2025-10-07 cs.AI 70%

H-DDx: A Hierarchical Evaluation Framework for Differential Diagnosis

Seungseop Lim, Gibaeg Kim, Hyunkyung Lee, Wooseok Han, Jean Seo, Jaehyo Yoo, Eunho Yang

机构 * AITRICS KAIST(韩国科学技术院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments GenAI4Health @NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01844 2025-10-07 cs.AI 70%

Towards Generalizable Context-aware Anomaly Detection: A Large-scale Benchmark in Cloud Environments

Xinkai Zou, Xuan Jiang, Ruikai Huang, Haoze He, Parv Kapoor, Hongrui Wu, Yibo Wang, Jian Sha, Xiongbo Shi, Zixun Huang, Jinhua Zhao

机构 * UC San Diego(加州大学圣地亚哥分校) Massachusetts Institute of Technology(麻省理工学院) Georgia Institute of Technology(佐治亚理工学院) Carnegie Mellon University(卡内基梅隆大学) Tongji University(同济大学) Tsinghua University(清华大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00883 2025-10-07 cs.CL 70%

Improve MLLM Benchmark Efficiency through Interview

Farong Wen, Yijin Guo, Junying Wang, Jiaohao Xiao, Yingjie Zhou, Ye Shen, Qi Jia, Chunyi Li, Zicheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13793 2025-10-07 cs.SE cs.AI 70%

Mapping the Trust Terrain: LLMs in Software Engineering -- Insights and Perspectives

Dipin Khati, Yijin Liu, David N. Palacio, Yixuan Zhang, Denys Poshyvanyk

机构 * William & Mary(威廉玛丽学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted to appear in IEEE Transactions on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04648 2025-10-07 cs.CV cs.CY 67%

EduPersona: Benchmarking Subjective Ability Boundaries of Virtual Student Agents

Buyuan Zhu, Shiyu Hu, Yiping Ma, Yuanming Zhang, Kang Hao Cheong

机构 * School of Physical and Mathematical Sciences, Nanyang Technological University(南洋理工大学物理与数学科学学院) Lab of Artificial Intelligence for Education, East China Normal University(华东师范大学教育人工智能实验室) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) State Key Laboratory of Robotics and Systems, Harbin Institute of Technology(哈尔滨工业大学机器人系统国家重点实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08942 2025-10-07 cs.LG cs.AI cs.CL 67%

AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories

Xing Han Lù, Amirhossein Kazemnejad, Nicholas Meade, Arkil Patel, Dongchan Shin, Alejandra Zambrano, Karolina Stańczak, Peter Shaw, Christopher J. Pal, Siva Reddy

机构 * McGill University(麦吉尔大学) Mila Quebec AI Institute(魁北克AI研究院) Google DeepMind(谷歌DeepMind) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair) Polytechnique Montréal(蒙特利尔理工学院) ServiceNow Research(ServiceNow研究)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16580 2025-10-07 cs.CR 67%

Can Indirect Prompt Injection Attacks Be Detected and Removed?

Yulin Chen, Haoran Li, Yuan Sui, Yufei He, Yue Liu, Yangqiu Song, Bryan Hooi

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03341 2025-10-07 cs.CV 67%

OpusAnimation: Code-Based Dynamic Chart Generation

Bozheng Li, Miao Yang, Zhenhan Chen, Jiawang Cao, Mushui Liu, Yi Lu, Yongliang Wu, Bin Zhang, Yangguang Ji, Licheng Tang, Jay Wu, Wenbo Zhu

机构 * Opus AI Research(Opus人工智能研究机构) Brown University(布朗大学) Zhejiang University(浙江大学) University of Toronto(多伦多大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04341 2025-10-07 cs.LG cs.AI 62%

Critical appraisal of artificial intelligence for rare-event recognition: principles and pharmacovigilance case studies

G. Niklas Noren, Eva-Lisa Meldau, Johan Ellenius

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

Comments 28 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04001 2025-10-07 cs.CL cs.AI 62%

Named Entity Recognition in COVID-19 tweets with Entity Knowledge Augmentation

Xuankang Zhang, Jiangming Liu

机构 * School of Information Science and Engineering, Yunnan University(信息科学与工程学院,云南大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21016 2025-10-07 cs.LG cs.CL 62%

RL Grokking Recipe: How Does RL Unlock and Transfer New Algorithms in LLMs?

Yiyou Sun, Yuhan Cao, Pohao Huang, Haoyue Bai, Hannaneh Hajishirzi, Nouha Dziri, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of Wisconsin, Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学) Ai2 Main dataset contributor(Ai2 主数据贡献者)

专题命中 评测与基准 :post-training(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03285 2025-10-07 cs.AI cs.CR cs.LG 62%

WAREX: Web Agent Reliability Evaluation on Existing Benchmarks

Su Kara, Fazle Faisal, Suman Nath

机构 * Stanford University(斯坦福大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04934 2025-10-07 eess.AS cs.AI 57%

AURA Score: A Metric For Holistic Audio Question Answering Evaluation

Satvik Dixit, Soham Deshmukh, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04438 2025-10-07 cs.CV cs.CL 57%

The Telephone Game: Evaluating Semantic Drift in Unified Models

Sabbir Mollah, Rohit Gupta, Sirnam Swetha, Qingyang Liu, Ahnaf Munir, Mubarak Shah

机构 * Center For Research in Computer Vision, University of Central Florida, USA(计算机视觉研究中心,中央佛罗里达大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04354 2025-10-07 cs.RO cs.AI cs.SY eess.SY 57%

Reliable and Scalable Robot Policy Evaluation with Imperfect Simulators

Apurva Badithela, David Snyder, Lihan Zha, Joseph Mikhail, Matthew O'Kelly, Anushri Dixit, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学) University of Texas, Austin(德克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04202 2025-10-07 cs.LG 57%

Spectral Alignment as Predictor of Loss Explosion in Neural Network Training

Haiquan Qiu, You Wu, Yingjie Tan, Yaqing Wang, Quanming Yao

机构 * Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03984 2025-10-07 cs.IR cs.LG 57%

Beyond Static Evaluation: Rethinking the Assessment of Personalized Agent Adaptability in Information Retrieval

Kirandeep Kaur, Preetam Prabhu Srikar Dammu, Hideo Joho, Chirag Shah

机构 * University of Washington(华盛顿大学) University of Tsukuba(筑波大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

Journal ref Proceedings of the 2025 Annual International ACM SIGIR Conference on Research and Development in Information Retrieval in the Asia Pacific Region

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03771 2025-10-07 cs.AI 57%

OptAgent: Optimizing Query Rewriting for E-commerce via Multi-Agent Simulation

Divij Handa, David Blincoe, Orson Adams, Yinlin Fu

机构 * Arizona State University(亚利桑那州立大学) Etsy

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18857 2025-10-07 cs.CV cs.LG 57%

Probabilistic Language-Image Pre-Training

Sanghyuk Chun, Wonjae Kim, Song Park, Sangdoo Yun

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

Comments Code: https://github.com/naver-ai/prolip HuggingFace Hub: https://huggingface.co/collections/SanghyukChun/prolip-6712595dfc87fd8597350291 33 pages, 4.5 MB; LongProLIP paper: arXiv:2503.08048; Multiplicity paper for more background: arxiv.org:2505.19614; v4: fix typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03458 2025-10-07 cs.CL 57%

Omni-Embed-Nemotron: A Unified Multimodal Retrieval Model for Text, Image, Audio, and Video

Mengyao Xu, Wenfei Zhou, Yauhen Babakhin, Gabriel Moreira, Ronay Ak, Radek Osmulski, Bo Liu, Even Oldridge, Benedikt Schifferer

机构 * NVIDIA

专题命中 评测与基准 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏