arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-08 至 2025-10-08 共收录 194 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 49 篇

2510.05184 2025-10-08 cs.AI 83%

Representation Potentials of Foundation Models for Multimodal Alignment: A Survey

Jianglin Lu, Hailing Wang, Yi Xu, Yizhou Wang, Kuo Yang, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系) Khoury College of Computer Science, Northeastern University(东北大学科赫里计算机科学学院)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

Journal ref The 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01241 2025-10-08 cs.CL 83%

ExpertLongBench: Benchmarking Language Models on Expert-Level Long-Form Generation Tasks with Structured Checklists

Jie Ruan, Inderjeet Nair, Shuyang Cao, Amy Liu, Sheza Munir, Micah Pollens-Dempsey, Tiffany Chiang, Lucy Kates, Nicholas David, Sihan Chen, Ruxin Yang, Yuqian Yang, Jasmine Gump, Tessa Bialek, Vivek Sankaran, Margo Schlanger, Lu Wang

机构 * Computer Science and Engineering, University of Michigan(计算机科学与工程系,密歇根大学) University of Michigan Law School(密歇根大学法学院) School of Information, University of Michigan(信息学院,密歇根大学) Materials Science & Engineering, University of Michigan(材料科学与工程系,密歇根大学) Department of Chemistry, Carnegie Mellon University(化学系,卡内基梅隆大学) Biomedical Engineering, University of Michigan(生物医学工程系,密歇根大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22584 2025-10-08 cs.LG cs.AI cs.CL 80%

BenchAgents: Multi-Agent Systems for Structured Benchmark Creation

Natasha Butt, Varun Chandrasekaran, Neel Joshi, Besmira Nushi, Vidhisha Balachandran

机构 * University of Amsterdam(阿姆斯特丹大学) Microsoft Research(微软研究院) UIUC(伊利诺伊大学香槟分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05310 2025-10-08 cs.CL cs.AI 79%

RAG Makes Guardrails Unsafe? Investigating Robustness of Guardrails under RAG-style Contexts

Yining She, Daniel W. Peterson, Marianne Menglin Liu, Vikas Upadhyay, Mohammad Hossein Chaghazardi, Eunsuk Kang, Dan Roth

机构 * Carnegie Mellon University(卡内基梅隆大学) Oracle Cloud Infrastructure(Oracle 云基础设施) University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05136 2025-10-08 cs.CL cs.AI 79%

Linguistic Characteristics of AI-Generated Text: A Survey

Luka Terčon, Kaja Dobrovoljc

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19521 2025-10-08 cs.CL cs.LG 79%

Intent-Aware Schema Generation And Refinement For Literature Review Tables

Vishakh Padmakumar, Joseph Chee Chang, Kyle Lo, Doug Downey, Aakanksha Naik

机构 * New York University(纽约大学) AI2 Northwestern University(西北大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments To Appear at EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22385 2025-10-08 cs.CV cs.AI cs.CL 79%

Can Video Large Multimodal Models Think Like Doubters-or Double-Down: A Study on Defeasible Video Entailment

Yue Zhang, Jilei Sun, Yunhui Guo, Vibhav Gogate

机构 * Department of Computer Science(计算机科学系) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08234 2025-10-08 cs.CL cs.AI 79%

Compound AI Systems Optimization: A Survey of Methods, Challenges, and Future Directions

Yu-Ang Lee, Guan-Ting Yi, Mei-Yi Liu, Jui-Chao Lu, Guan-Bo Yang, Yun-Nung Chen

机构 * National Taiwan University(国立台湾大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10663 2025-10-08 q-bio.NC cs.AI cs.CV cs.LG 79%

Optimal Transport for Brain-Image Alignment: Unveiling Redundancy and Synergy in Neural Information Processing

Yang Xiao, Wang Lu, Jie Ji, Ruimeng Ye, Gen Li, Xiaolong Ma, Bo Hui

机构 * University of Tulsa(图拉大学) Tsinghua University(清华大学) Clemson University(克莱姆森大学) The University of Arizona(亚利桑那大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 14pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05327 2025-10-08 cs.AR cs.AI 77%

DeepV: A Model-Agnostic Retrieval-Augmented Framework for Verilog Code Generation with a High-Quality Knowledge Base

Zahin Ibnat, Paul E. Calzada, Rasin Mohammed Ihtemam, Sujan Kumar Saha, Jingbo Zhou, Farimah Farahmandi, Mark Tehranipoor

机构 * University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05046 2025-10-08 cs.CL 77%

COLE: a Comprehensive Benchmark for French Language Understanding Evaluation

David Beauchemin, Yan Tremblay, Mohamed Amine Youssef, Richard Khoury

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Submitted to ACL Rolling Review of October

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05968 2025-10-08 cs.SE 75%

Extending ResourceLink: Patterns for Large Dataset Processing in MCP Applications

Scott Frees

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05450 2025-10-08 cs.SE 75%

What Types of Code Review Comments Do Developers Most Frequently Resolve?

Saul Goldman, Hong Yi Lin, Jirat Pasuksmit, Patanamon Thongtanunam, Kla Tantithamthavorn, Zhe Wang, Ray Zhang, Ali Behnaz, Fan Jiang, Michael Siers, Ryan Jiang, Mike Buller, Minwoo Jeong, Ming Wu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments The paper has been accepted the 40th IEEE/ACM International Conference on Automated Software Engineering, ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00192 2025-10-08 cs.CV 75%

Safe-LLaVA: A Privacy-Preserving Vision-Language Dataset and Benchmark for Biometric Safety

Younggun Kim, Sirnam Swetha, Fazil Kagdi, Mubarak Shah

机构 * Center For Research in Computer Vision, University of Central Florida, USA(计算机视觉研究中心,中央佛罗里达大学) Department of Civil Environmental and Construction Engineering, University of Central Florida, USA(土木环境与建设工程系,中央佛罗里达大学) Department of Computer Science, University of Central Florida, USA(计算机科学系,中央佛罗里达大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05128 2025-10-08 cs.CL cs.CV eess.AS 74%

Advancing Automated Spatio-Semantic Analysis in Picture Description Using Language Models

Si-Ioi Ng, Pranav S. Ambadi, Kimberly D. Mueller, Julie Liss, Visar Berisha

机构 * Arizona State University(亚利桑那州立大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25203 2025-10-08 cs.SE cs.AI 74%

Generating High-Quality Datasets for Code Editing via Open-Source Language Models

Zekai Zhang, Mingwei Liu, Zhenxi Chen, Linxi Liang, Yuxuan Chen, Guangsheng Ou, Yanlin Wang, Dan Li, Xin Peng, Zibin Zheng

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院) School of Computer Science, Fudan University(复旦大学计算机学院)

专题命中 评测与基准 :language model(title);分类 cs.AI

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09946 2025-10-08 cs.AI cs.CL 73%

Fine-Grained and Thematic Evaluation of LLMs in Social Deduction Game

Byungjun Kim, Dayeon Seo, Minju Kim, Bugeun Kim

机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul, Republic of Korea(人工智能系, Chung-Ang大学,首尔,韩国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Published in IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22304 2025-10-08 cs.CV 67%

CADReview: Automatically Reviewing CAD Programs with Error Detection and Correction

Jiali Chen, Xusen Hei, HongFei Liu, Yuancheng Wei, Zikun Deng, Jiayuan Xie, Yi Cai, Li Qing

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件学院) Key Laboratory of Big Data and Intelligent Robot Ministry of Education(教育部大数据与智能机器人重点实验室) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments ACL 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05519 2025-10-08 cs.CY 67%

Assessing Human Rights Risks in AI: A Framework for Model Evaluation

Vyoma Raman, Camille Chabot, Betsy Popken

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments AAAI/ACM Conference on AI, Ethics, and Society (AIES) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19271 2025-10-08 cs.SE 67%

VerifyThisBench: Generating Code, Specifications, and Proofs All at Once

Xun Deng, Sicheng Zhong, Barış Bayazıt, Andreas Veneris, Fan Long, Xujie Si

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06071 2025-10-08 cs.LG cs.AI cs.HC 62%

Benchmark It Yourself (BIY): Preparing a Dataset and Benchmarking AI Models for Scatterplot-Related Tasks

João Palmeiro, Diogo Duarte, Rita Costa, Pedro Bizarro

机构 * Feedzai

专题命中 评测与基准 :prompting(abstract);分类 cs.AI、cs.LG

Comments 9 pages, 3 figures, short paper accepted at VISxGenAI: 1st Workshop on GenAI, Agents, and the Future of VIS (IEEE VIS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05976 2025-10-08 cs.CV cs.AI cs.LG 62%

Diffusion Models for Low-Light Image Enhancement: A Multi-Perspective Taxonomy and Performance Analysis

Eashan Adhikarla, Yixin Liu, Brian D. Davison

机构 * Lehigh University(莱维大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05756 2025-10-08 cs.SD cs.LG eess.AS 57%

Transcribing Rhythmic Patterns of the Guitar Track in Polyphonic Music

Aleksandr Lukoianov, Anssi Klapuri

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

Comments Accepted to WASPAA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05458 2025-10-08 cs.CL 57%

SocialNLI: A Dialogue-Centric Social Inference Dataset

Akhil Deo, Kate Sanders, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05551 2025-10-08 cs.CV 50%

When Semantics Mislead Vision: Mitigating Large Multimodal Models Hallucinations in Scene Text Spotting and Understanding

Yan Shu, Hangui Lin, Yexin Liu, Yan Zhang, Gangyan Zeng, Yan Li, Yu Zhou, Ser-Nam Lim, Harry Yang, Nicu Sebe

机构 * University of Trento(特伦托大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of International Relations(国际关系大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Nanjing University of Science and Technology(南京理工大学) VCIP & TMCC & DISSec, College of Computer Science, Nankai University(南开大学计算机学院) University of Central Florida(佛罗里达中央大学)

专题命中 评测与基准 :LLM(abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05556 2025-10-08 cs.DC cs.OS 50%

Toward Systems Foundations for Agentic Exploration

Jiakai Xu, Tianle Zhou, Eugene Wu, Kostis Kaffes

专题命中 评测与基准 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17906 2025-10-08 q-fin.CP q-fin.PM 50%

FinReflectKG: Agentic Construction and Evaluation of Financial Knowledge Graphs

Abhinav Arun, Fabrizio Dimino, Tejas Prakash Agarwal, Bhaskarjit Sarmah, Stefano Pasquali

专题命中 评测与基准 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 37 篇

2509.09947 2025-10-08 cs.SE 92%

Toward Green Code: Prompting Small Language Models for Energy-Efficient Code Generation

Humza Ashraf, Syed Muhammad Danish, Shadikur Rahman, Zeeshan Sattar

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);prompting(title,abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05943 2025-10-08 cs.DC cs.LG 90%

EARL: Efficient Agentic Reinforcement Learning Systems for Large Language Models

Zheyue Tan, Mustapha Abdullahi, Tuo Shi, Huining Yuan, Zelai Xu, Chao Yu, Boxun Li, Bo Zhao

机构 * Aalto University(阿alto大学) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21432 2025-10-08 cs.CL cs.AI 90%

Towards Locally Deployable Fine-Tuned Causal Large Language Models for Mode Choice Behaviour

Tareq Alsaleh, Bilal Farooq

机构 * Laboratory of Innovations in Transportation (LiTrans), Toronto Metropolitan University, Canada(交通创新实验室(LiTrans)、多伦多 Metropolitan 大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏