arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-08 至 2025-10-08 共收录 49 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 49 篇

2510.05935 2025-10-08 cs.LG cs.AI 92%

LLM-FS-Agent: A Deliberative Role-based Large Language Model Architecture for Transparent Feature Selection

Mohamed Bal-Ghaoui, Fayssal Sabri

机构 * R&D Department, Audensiel Conseil(Audensiel Conseil 研发部) Ecole Centrale de Lyon(Lyon 工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08989 2025-10-08 cs.CL cs.AI 91%

Robustness of Large Language Models to Perturbations in Text

Ayush Singh, Navpreet Singh, Shubham Vatsal

机构 * inQbator AI at eviCore Healthcare Evernorth Health Services(inQbator AI 位于 eviCore 医疗保健 Evernorth 健康服务)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 8 pages, 1 figure, 6 tables, updated with results also from GPT-4, LLaMa-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05151 2025-10-08 cs.CL cs.LG 90%

Exploring Large Language Models for Financial Applications: Techniques, Performance, and Challenges with FinMA

Prudence Djagba, Abdelkader Y. Saley

机构 * Lyman Briggs College, Michigan State University(密歇根州立大学Lyman Briggs学院) Department of Finance, Michigan State University(密歇根州立大学金融系) African Institute for Mathematical Sciences, Rwanda(刚果(金)数学科学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21840 2025-10-08 cs.LO cs.AI 89%

Can Large Language Models Autoformalize Kinematics?

Aditi Kabra, Jonathan Laurent, Sagar Bharadwaj, Ruben Martins, Stefan Mitsch, André Platzer

机构 * Carnegie Mellon University(卡内基梅隆大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) DePaul University(德保罗大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Journal ref Proc. 25th International Conference on Formal Methods in Computer-Aided Design (FMCAD), pp. 78-83, TU Wien Academic Press, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05533 2025-10-08 q-fin.PM 89%

The New Quant: A Survey of Large Language Models in Financial Prediction and Trading

Weilong Fu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05365 2025-10-08 cs.SE 89%

Test Case Generation from Bug Reports via Large Language Models: A Cognitive Layered Evaluation Framework

Irtaza Sajid Qureshi, Zhen Ming, Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07983 2025-10-08 cs.CL cs.AI cs.CY 88%

ArabLegalEval: A Multitask Benchmark for Assessing Arabic Legal Knowledge in Large Language Models

Faris Hijazi, Somayah AlHarbi, Abdulaziz AlHussein, Harethah Abu Shairah, Reem AlZahrani, Hebah AlShamlan, Omar Knio, George Turkiyyah

机构 * THIQAH KAUST

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03408 2025-10-08 cs.CL cs.CV 88%

Trajectory Prediction Meets Large Language Models: A Survey

Yi Xu, Ruining Yang, Yitian Zhang, Jianglin Lu, Mingyuan Zhang, Yizhou Wang, Lili Su, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 16 pages, GitHub: https://github.com/colorfulfuture/Awesome-Trajectory-Motion-Prediction-Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05135 2025-10-08 cs.CL cs.LG 88%

Curiosity-Driven LLM-as-a-judge for Personalized Creative Judgment

Vanya Bannihatti Kumar, Divyanshu Goyal, Akhil Eppa, Neel Bhandari

机构 * Adobe Inc.(Adobe公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07966 2025-10-08 cs.CV 88%

SpaCE-10: A Comprehensive Benchmark for Multimodal Large Language Models in Compositional Spatial Intelligence

Ziyang Gong, Wenhao Li, Oliver Ma, Songyuan Li, Zhaokai Wang, Songyuan Li, Jiayi Ji, Xue Yang, Gen Luo, Junchi Yan, Rongrong Ji

机构 * SJTU(上海交通大学) XMU(厦门大学) Shanghai AI Lab(上海人工智能实验室) SYSU(南方科技大学) FDU(福建大学) NUS(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06595 2025-10-08 cs.CL cs.AI cs.LG 87%

LLM Unlearning Without an Expert Curated Dataset

Xiaoyuan Zhu, Muru Zhang, Ollie Liu, Robin Jia, Willie Neiswanger

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09387 2025-10-08 cs.LG cs.AI 86%

MetaLLMix : An XAI Aided LLM-Meta-learning Based Approach for Hyper-parameters Optimization

Mohamed Bal-Ghaoui, Mohammed Tiouti

机构 * R&D Department, Audensiel Conseil Paris, France(Audensiel Conseil 巴黎法国研发部) Université Évry Paris-Saclay(Évry 巴黎-萨克莱大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05152 2025-10-08 cs.CL cs.AI 86%

A Single Character can Make or Break Your LLM Evals

Jingtong Su, Jianyu Zhang, Karen Ullrich, Léon Bottou, Mark Ibrahim

机构 * FAIR at Meta(Meta 的 FAIR 研究院) New York University(纽约大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05131 2025-10-08 cs.CL cs.AI 86%

Rationale-Augmented Retrieval with Constrained LLM Re-Ranking for Task Discovery

Bowen Wei

机构 * George Mason University(乔治·马歇尔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06018 2025-10-08 cs.CL 85%

Evaluating The Impact of Stimulus Quality in Investigations of LLM Language Performance

Timothy Pistotti, Jason Brown, Michael Witbrock

机构 * University of Auckland(奥克兰大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Presented at https://brigap-workshop.github.io/ Information to be updated upon publication of proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06001 2025-10-08 cs.CL 85%

Exploring Gaps in the APS: Direct Minimal Pair Analysis in LLM Syntactic Assessments

Timothy Pistotti, Jason Brown, Michael Witbrock

机构 * University of Auckland(奥克兰大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Presented at the https://brigap-workshop.github.io/ Information to be updated after publication of proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15436 2025-10-08 cs.HC cs.AI 85%

Ads that Talk Back: Implications and Perceptions of Injecting Personalized Advertising into LLM Chatbots

Brian Jay Tang, Kaiwen Sun, Noah T. Curran, Florian Schaub, Kang G. Shin

机构 * University of Michigan(密歇根大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Journal ref Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies 2025, (UbiComp)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05605 2025-10-08 cs.CR cs.AI 85%

AutoPentester: An LLM Agent-based Framework for Automated Pentesting

Yasod Ginige, Akila Niroshan, Sajal Jain, Suranga Seneviratne

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments IEEE TrustCom 2025 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05139 2025-10-08 cs.CL 85%

NLD-LLM: A systematic framework for evaluating small language transformer models on natural language description

Hamed Jelodar, Mohammad Meymani, Parisa Hamedi, Tochukwu Emmanuel Nwankwo, Samita Bai, Roozbeh Razavi-Far, Ali A. Ghorbani

机构 * Faculty of Computer Science(计算机科学学院) University of New Brunswick(新不伦瑞克大学)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18122 2025-10-08 cs.AI cs.CL 85%

GAUSS: Benchmarking Structured Mathematical Skills for Large Language Models

Yue Zhang, Jiaxin Zhang, Qiuyu Ren, Tahsin Saffat, Xiaoxuan Liu, Zitong Yang, Banghua Zhu, Yi Ma

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

Comments 120 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06104 2025-10-08 cs.SE 85%

Explaining Code Risk in OSS: Towards LLM-Generated Fault Prediction Interpretations

Elijah Kayode Adejumo, Brittany Johnson

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02418 2025-10-08 cs.AI cs.LG 84%

BrowserArena: Evaluating LLM Agents on Real-World Web Navigation Tasks

Sagnik Anupam, Davis Brown, Shuo Li, Eric Wong, Hamed Hassani, Osbert Bastani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05184 2025-10-08 cs.AI 83%

Representation Potentials of Foundation Models for Multimodal Alignment: A Survey

Jianglin Lu, Hailing Wang, Yi Xu, Yizhou Wang, Kuo Yang, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系) Khoury College of Computer Science, Northeastern University(东北大学科赫里计算机科学学院)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

Journal ref The 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01241 2025-10-08 cs.CL 83%

ExpertLongBench: Benchmarking Language Models on Expert-Level Long-Form Generation Tasks with Structured Checklists

Jie Ruan, Inderjeet Nair, Shuyang Cao, Amy Liu, Sheza Munir, Micah Pollens-Dempsey, Tiffany Chiang, Lucy Kates, Nicholas David, Sihan Chen, Ruxin Yang, Yuqian Yang, Jasmine Gump, Tessa Bialek, Vivek Sankaran, Margo Schlanger, Lu Wang

机构 * Computer Science and Engineering, University of Michigan(计算机科学与工程系,密歇根大学) University of Michigan Law School(密歇根大学法学院) School of Information, University of Michigan(信息学院,密歇根大学) Materials Science & Engineering, University of Michigan(材料科学与工程系,密歇根大学) Department of Chemistry, Carnegie Mellon University(化学系,卡内基梅隆大学) Biomedical Engineering, University of Michigan(生物医学工程系,密歇根大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22584 2025-10-08 cs.LG cs.AI cs.CL 80%

BenchAgents: Multi-Agent Systems for Structured Benchmark Creation

Natasha Butt, Varun Chandrasekaran, Neel Joshi, Besmira Nushi, Vidhisha Balachandran

机构 * University of Amsterdam(阿姆斯特丹大学) Microsoft Research(微软研究院) UIUC(伊利诺伊大学香槟分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05310 2025-10-08 cs.CL cs.AI 79%

RAG Makes Guardrails Unsafe? Investigating Robustness of Guardrails under RAG-style Contexts

Yining She, Daniel W. Peterson, Marianne Menglin Liu, Vikas Upadhyay, Mohammad Hossein Chaghazardi, Eunsuk Kang, Dan Roth

机构 * Carnegie Mellon University(卡内基梅隆大学) Oracle Cloud Infrastructure(Oracle 云基础设施) University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05136 2025-10-08 cs.CL cs.AI 79%

Linguistic Characteristics of AI-Generated Text: A Survey

Luka Terčon, Kaja Dobrovoljc

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19521 2025-10-08 cs.CL cs.LG 79%

Intent-Aware Schema Generation And Refinement For Literature Review Tables

Vishakh Padmakumar, Joseph Chee Chang, Kyle Lo, Doug Downey, Aakanksha Naik

机构 * New York University(纽约大学) AI2 Northwestern University(西北大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments To Appear at EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22385 2025-10-08 cs.CV cs.AI cs.CL 79%

Can Video Large Multimodal Models Think Like Doubters-or Double-Down: A Study on Defeasible Video Entailment

Yue Zhang, Jilei Sun, Yunhui Guo, Vibhav Gogate

机构 * Department of Computer Science(计算机科学系) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08234 2025-10-08 cs.CL cs.AI 79%

Compound AI Systems Optimization: A Survey of Methods, Challenges, and Future Directions

Yu-Ang Lee, Guan-Ting Yi, Mei-Yi Liu, Jui-Chao Lu, Guan-Bo Yang, Yun-Nung Chen

机构 * National Taiwan University(国立台湾大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏