arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-10 至 2025-09-10 共收录 42 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 42 篇

2507.02074 2025-09-10 cs.CV cs.AI 89%

Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges

Sanjeda Akter, Ibne Farabi Shihab, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction and Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07010 2025-09-10 cs.CV cs.AI cs.ET 89%

Human-in-the-Loop: Quantitative Evaluation of 3D Models Generation by Large Language Models

Ahmed R. Sadik, Mariusz Bujny

机构 * Honda Research Institute Europe - Germany(本田欧洲研究机构)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01535 2025-09-10 cs.CL cs.AI 88%

CAT: Causal Attention Tuning For Injecting Fine-grained Causal Knowledge into Large Language Models

Kairong Han, Wenshuo Zhao, Ziyu Zhao, JunJian Ye, Lujia Pan, Kun Kuang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP2025 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19548 2025-09-10 cs.CL cs.SD eess.AS 88%

When Large Language Models Meet Speech: A Survey on Integration Approaches

Zhengdong Yang, Shuichiro Shimizu, Yahan Yu, Chenhui Chu

机构 * Kyoto University(京都大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted at Findings of ACL 2025 (Long Paper)

Journal ref Findings of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07389 2025-09-10 cs.CL cs.AI cs.HC cs.LG 87%

Talking with Oompa Loompas: A novel framework for evaluating linguistic acquisition of LLM agents

Sankalp Tattwadarshi Swain, Anshika Krishnatray, Dhruv Kumar, Jagat Sesh Challa

机构 * BITS Pilani(比特兰学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16661 2025-09-10 cs.CL 85%

A Japanese Language Model and Three New Evaluation Benchmarks for Pharmaceutical NLP

Shinnosuke Ono, Issey Sukeda, Takuro Fujii, Kosei Buma, Shunsuke Sasaki

机构 * EQUES Inc.(EQUES公司) The University of Tokyo(东京大学) University of Tsukuba(筑波大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.CL

Comments 15 pages, 9 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06472 2025-09-10 cs.IR 85%

Rethinking LLM Parametric Knowledge as Post-retrieval Confidence for Dynamic Retrieval and Reranking

Haoxiang Jin, Ronghan Li, Zixiang Lu, Qiguang Miao

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07133 2025-09-10 cs.IR cs.LG 83%

Avoiding Over-Personalization with Rule-Guided Knowledge Graph Adaptation for LLM Recommendations

Fernando Spadea, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute(拉特兰理工学院)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.LG

Comments 5 pages, 2 figures, ISWC

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18933 2025-09-10 cs.AI cs.CR cs.CY cs.LG 82%

VISION: Robust and Interpretable Code Vulnerability Detection Leveraging Counterfactual Augmentation

David Egea, Barproda Halder, Sanghamitra Dutta

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07540 2025-09-10 cs.SE cs.CR 82%

PatchSeeker: Mapping NVD Records to their Vulnerability-fixing Commits with LLM Generated Commits and Embeddings

Huu Hung Nguyen, Anh Tuan Nguyen, Thanh Le-Cong, Yikun Li, Han Wei Ang, Yide Yin, Frank Liauw, Shar Lwin Khin, Ouh Eng Lieh, Ting Zhang, David Lo

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10277 2025-09-10 cs.CY cs.AI cs.CL cs.CR 82%

RealHarm: A Collection of Real-World Language Model Application Failures

Pierre Le Jeune, Jiaen Liu, Luca Rossi, Matteo Dora

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI;LLM(journal_ref)

Journal ref ACL Proceedings of the The First Workshop on LLM Security (LLMSEC), pp. 87-100, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12363 2025-09-10 cs.CV cs.AI cs.CL cs.LG cs.RO 80%

Towards Visuospatial Cognition via Hierarchical Fusion of Visual Experts

Qi Feng

机构 * Kyoto University(京都大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 26 pages, 19 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05062 2025-09-10 cs.CL 79%

Debatable Intelligence: Benchmarking LLM Judges via Debate Speech Evaluation

Noy Sternlicht, Ariel Gera, Roy Bar-Haim, Tom Hope, Noam Slonim

机构 * School of Computer Science and Engineering, The Hebrew University of Jerusalem(计算机科学与工程学院,特拉维夫大学) IBM Research(IBM研究院) The Allen Institute for AI (AI2)(人工智能研究所)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

Comments EMNLP 2025. Code: https://github.com/noy-sternlicht/Debatable-Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07367 2025-09-10 cs.AI cs.LG cs.LO 79%

Autonomous Code Evolution Meets NP-Completeness

Cunxi Yu, Rongjian Liang, Chia-Tung Ho, Haoxing Ren

机构 * NVIDIA Research(NVIDIA研究)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07253 2025-09-10 cs.IR cs.AI cs.CL 79%

Benchmarking Information Retrieval Models on Complex Retrieval Tasks

Julian Killingback, Hamed Zamani

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07128 2025-09-10 cs.CL cs.AI cs.MM 79%

Cardiverse: Harnessing LLMs for Novel Card Game Prototyping

Danrui Li, Sen Zhang, Sam S. Sohn, Kaidong Hu, Muhammad Usman, Mubbasir Kapadia

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 37 pages, 13 figures, 8 tables. Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07225 2025-09-10 cs.CR 78%

All You Need Is A Fuzzing Brain: An LLM-Powered System for Automated Vulnerability Detection and Patching

Ze Sheng, Qingxiao Xu, Jianwei Huang, Matthew Woodcock, Heqing Huang, Alastair F. Donaldson, Guofei Gu, Jeff Huang

专题命中 评测与基准 :LLM(title,abstract)

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09790 2025-09-10 cs.SD 78%

BeatFM: Improving Beat Tracking with Pre-trained Music Foundation Model

Ganghui Ru, Jieying Wang, Jiahao Zhao, Yulun Wu, Yi Yu, Nannan Jiang, Wei Wang, Wei Li

机构 * School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机科学学院) Naval Medical Center, PLA, China(中国人民解放军海军医疗中心) Graduate School of Informatics, Kyoto University, Kyoto, Japan(京都大学信息科学研究生院) Graduate School of Advanced Science and Engineering, Hiroshima University, Hiroshima, Japan(广岛大学先进科学与工程研究生院) Shanghai Key Laboratory of Intelligent Information Processing, Fudan University, Shanghai, China(上海智能信息处理重点实验室)

专题命中 评测与基准 :foundation model(title,abstract)

Comments Early draft for discussion only. Undergoing active revision, conclusions subject to change. Do not cite. Formal peer-reviewed version in preparation

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07941 2025-09-10 cs.CR cs.AI 77%

ImportSnare: Directed "Code Manual" Hijacking in Retrieval-Augmented Code Generation

Kai Ye, Liangcai Su, Chenxiong Qian

机构 * The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments This paper has been accepted by the ACM Conference on Computer and Communications Security (CCS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07908 2025-09-10 cs.CL 77%

Biased Tales: Cultural and Topic Bias in Generating Children's Stories

Donya Rooein, Vilém Zouhar, Debora Nozza, Dirk Hovy

机构 * Bocconi University(博科尼大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04404 2025-09-10 cs.CY cs.AI cs.CL cs.HC 76%

No Thoughts Just AI: Biased LLM Hiring Recommendations Alter Human Decision Making and Limit Human Autonomy

Kyra Wilson, Mattea Sim, Anna-Maria Gueorguieva, Aylin Caliskan

机构 * Kyra Wilson(1 Kyra Wilson) Mattea Sim(2 Mattea Sim)

专题命中 评测与基准 :LLM(title);分类 cs.CL、cs.AI

Comments Published in Proceedings of the 2025 AAAI/ACM Conference on AI, Ethics, and Society; code available at https://github.com/kyrawilson/No-Thoughts-Just-AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07764 2025-09-10 cs.CR 75%

AgentSentinel: An End-to-End and Real-Time Security Defense Framework for Computer-Use Agents

Haitao Hu, Peng Chen, Yanpeng Zhao, Yuqi Chen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07315 2025-09-10 cs.CR cs.SE 75%

SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMs

Hongfei Xia, Hongru Wang, Zeming Liu, Qian Yu, Yuhang Guo, Haifeng Wang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02603 2025-09-10 cs.HC 75%

Generative AI as a Tool for Enhancing Reflective Learning in Students

Bo Yuan, Jiazi Hu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted by IEEE TALE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17180 2025-09-10 cs.AI cs.CV cs.LG 73%

MaRVL-QA: A Benchmark for Mathematical Reasoning over Visual Landscapes

Nilay Pande, Sahiti Yerramilli, Jayant Sravan Tamarapalli, Rynaa Grover

机构 * Waymo Google(谷歌)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16665 2025-09-10 cs.CL cs.AI 73%

Trust but Verify! A Survey on Verification Design for Test-time Scaling

V Venktesh, Mandeep Rathee, Avishek Anand

机构 * Stockholm University(斯德哥尔摩大学) L3S Research Center(L3S研究中心) TU Delft(代尔夫特理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22286 2025-09-10 cs.CL cs.AI 73%

Meaning-infused grammar: Gradient Acceptability Shapes the Geometric Representations of Constructions in LLMs

Supantho Rakshit, Adele Goldberg

机构 * Princeton University(普林斯顿大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 6 pages, 3 figures, Accepted for publication at the Second International Workshop on Construction Grammars and NLP at the 16th International Conference for Computational Semantics (IWCS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06975 2025-09-10 cs.LG cs.AI 73%

GSTBench: A Benchmark Study on the Transferability of Graph Self-Supervised Learning

Yu Song, Zhigang Hua, Yan Xie, Jingzhe Liu, Bo Long, Hui Liu

机构 * Computer Science and Engineering(计算机科学与工程) Michigan State University(密歇根州立大学) Meta

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments Accepted at CIKM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07676 2025-09-10 cs.AI 70%

Unleashing the True Potential of LLMs: A Feedback-Triggered Self-Correction with Long-Term Multipath Decoding

Jipeng Li, Zeyu Gao, Yubin Qi, Hande Dong, Weijian Chen, Qiang Lin

机构 * Tencent(腾讯) Tsinghua University(清华大学) Institute of Dataspace, Hefei Comprehensive National Science Center(数据空间研究所,合肥综合性国家科学中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07473 2025-09-10 cs.AI 70%

SheetDesigner: MLLM-Powered Spreadsheet Layout Generation with Rule-Based and Vision-Based Reflection

Qin Chen, Yuanyi Ren, Xiaojun Ma, Mugeng Liu, Han Shi, Dongmei Zhang

机构 * Peking University(北京大学) Microsoft(微软)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏