arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-08 至 2025-10-08 共收录 194 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 28 篇

2509.23250 2025-10-08 cs.AI cs.CV 70%

Training Vision-Language Process Reward Models for Test-Time Scaling in Multimodal Reasoning: Key Insights and Lessons Learned

Brandon Ong, Tej Deep Pala, Vernon Toh, William Chandra Tjhi, Soujanya Poria

机构 * AI Singapore(AI新加坡) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17132 2025-10-08 cs.AI 70%

Applications of Large Models in Medicine

YunHe Su, Zhengyang Lu, Junhui Liu, Ke Pang, Haoran Dai, Sa Liu, Yuxin Jia, Lujia Ge, Jing-min Yang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08833 2025-10-08 cs.CY 67%

Position: The Pitfalls of Over-Alignment: Overly Caution Health-Related Responses From LLMs are Unethical and Dangerous

Wenqi Marshall Guo, Yiyang Du, Heidi J. S. Tworek, Shan Du

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05871 2025-10-08 cs.AI cs.LG 62%

Towards Label-Free Biological Reasoning Synthetic Dataset Creation via Uncertainty Filtering

Josefa Lia Stoisser, Lawrence Phillips, Aditya Misra, Tom A. Lamb, Philip Torr, Marc Boubnovski Martell, Julien Fauqueur, Kaspar Märtens

机构 * Novo Nordisk(诺华制药) University of Oxford(牛津大学)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17242 2025-10-08 cs.LG cs.AI 62%

Optimal Policy Minimum Bayesian Risk

Ramón Fernandez Astudillo, Md Arafat Sultan, Aashka Trivedi, Yousef El-Kurdi, Tahira Naseem, Radu Florian, Salim Roukos

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02563 2025-10-08 cs.LG cs.CL 62%

DynaGuard: A Dynamic Guardian Model With User-Defined Policies

Monte Hoover, Vatsal Baherwani, Neel Jain, Khalid Saifullah, Joseph Vincent, Chirag Jain, Melissa Kazemi Rad, C. Bayan Bruss, Ashwinee Panda, Tom Goldstein

机构 * University of Maryland(马里兰大学) Capital One

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

Comments 22 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14763 2025-10-08 cs.CL 57%

Unifying Inference-Time Planning Language Generation

Prabhu Prakash Kagitha, Bo Sun, Ishan Desai, Andrew Zhu, Cassie Huang, Manling Li, Ziyang Li, Li Zhang

机构 * Drexel University(德雷塞尔大学) University of Pennsylvania(宾夕法尼亚大学) Northwestern University(西北大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05362 2025-10-08 cs.CL 57%

Residualized Similarity for Faithfully Explainable Authorship Verification

Peter Zeng, Pegah Alipoormolabashi, Jihu Mun, Gourab Dey, Nikita Soni, Niranjan Balasubramanian, Owen Rambow, H. Schwartz

机构 * Department of Computer Science(计算机科学系) Department of Linguistics(语言学系) Institute for Advanced Computational Science(先进计算科学研究院) Stony Brook University(石溪大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 49 篇

2510.05935 2025-10-08 cs.LG cs.AI 92%

LLM-FS-Agent: A Deliberative Role-based Large Language Model Architecture for Transparent Feature Selection

Mohamed Bal-Ghaoui, Fayssal Sabri

机构 * R&D Department, Audensiel Conseil(Audensiel Conseil 研发部) Ecole Centrale de Lyon(Lyon 工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08989 2025-10-08 cs.CL cs.AI 91%

Robustness of Large Language Models to Perturbations in Text

Ayush Singh, Navpreet Singh, Shubham Vatsal

机构 * inQbator AI at eviCore Healthcare Evernorth Health Services(inQbator AI 位于 eviCore 医疗保健 Evernorth 健康服务)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 8 pages, 1 figure, 6 tables, updated with results also from GPT-4, LLaMa-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05151 2025-10-08 cs.CL cs.LG 90%

Exploring Large Language Models for Financial Applications: Techniques, Performance, and Challenges with FinMA

Prudence Djagba, Abdelkader Y. Saley

机构 * Lyman Briggs College, Michigan State University(密歇根州立大学Lyman Briggs学院) Department of Finance, Michigan State University(密歇根州立大学金融系) African Institute for Mathematical Sciences, Rwanda(刚果(金)数学科学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21840 2025-10-08 cs.LO cs.AI 89%

Can Large Language Models Autoformalize Kinematics?

Aditi Kabra, Jonathan Laurent, Sagar Bharadwaj, Ruben Martins, Stefan Mitsch, André Platzer

机构 * Carnegie Mellon University(卡内基梅隆大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) DePaul University(德保罗大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Journal ref Proc. 25th International Conference on Formal Methods in Computer-Aided Design (FMCAD), pp. 78-83, TU Wien Academic Press, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05533 2025-10-08 q-fin.PM 89%

The New Quant: A Survey of Large Language Models in Financial Prediction and Trading

Weilong Fu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05365 2025-10-08 cs.SE 89%

Test Case Generation from Bug Reports via Large Language Models: A Cognitive Layered Evaluation Framework

Irtaza Sajid Qureshi, Zhen Ming, Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07983 2025-10-08 cs.CL cs.AI cs.CY 88%

ArabLegalEval: A Multitask Benchmark for Assessing Arabic Legal Knowledge in Large Language Models

Faris Hijazi, Somayah AlHarbi, Abdulaziz AlHussein, Harethah Abu Shairah, Reem AlZahrani, Hebah AlShamlan, Omar Knio, George Turkiyyah

机构 * THIQAH KAUST

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03408 2025-10-08 cs.CL cs.CV 88%

Trajectory Prediction Meets Large Language Models: A Survey

Yi Xu, Ruining Yang, Yitian Zhang, Jianglin Lu, Mingyuan Zhang, Yizhou Wang, Lili Su, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 16 pages, GitHub: https://github.com/colorfulfuture/Awesome-Trajectory-Motion-Prediction-Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05135 2025-10-08 cs.CL cs.LG 88%

Curiosity-Driven LLM-as-a-judge for Personalized Creative Judgment

Vanya Bannihatti Kumar, Divyanshu Goyal, Akhil Eppa, Neel Bhandari

机构 * Adobe Inc.(Adobe公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07966 2025-10-08 cs.CV 88%

SpaCE-10: A Comprehensive Benchmark for Multimodal Large Language Models in Compositional Spatial Intelligence

Ziyang Gong, Wenhao Li, Oliver Ma, Songyuan Li, Zhaokai Wang, Songyuan Li, Jiayi Ji, Xue Yang, Gen Luo, Junchi Yan, Rongrong Ji

机构 * SJTU(上海交通大学) XMU(厦门大学) Shanghai AI Lab(上海人工智能实验室) SYSU(南方科技大学) FDU(福建大学) NUS(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06595 2025-10-08 cs.CL cs.AI cs.LG 87%

LLM Unlearning Without an Expert Curated Dataset

Xiaoyuan Zhu, Muru Zhang, Ollie Liu, Robin Jia, Willie Neiswanger

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09387 2025-10-08 cs.LG cs.AI 86%

MetaLLMix : An XAI Aided LLM-Meta-learning Based Approach for Hyper-parameters Optimization

Mohamed Bal-Ghaoui, Mohammed Tiouti

机构 * R&D Department, Audensiel Conseil Paris, France(Audensiel Conseil 巴黎法国研发部) Université Évry Paris-Saclay(Évry 巴黎-萨克莱大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05152 2025-10-08 cs.CL cs.AI 86%

A Single Character can Make or Break Your LLM Evals

Jingtong Su, Jianyu Zhang, Karen Ullrich, Léon Bottou, Mark Ibrahim

机构 * FAIR at Meta(Meta 的 FAIR 研究院) New York University(纽约大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05131 2025-10-08 cs.CL cs.AI 86%

Rationale-Augmented Retrieval with Constrained LLM Re-Ranking for Task Discovery

Bowen Wei

机构 * George Mason University(乔治·马歇尔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06018 2025-10-08 cs.CL 85%

Evaluating The Impact of Stimulus Quality in Investigations of LLM Language Performance

Timothy Pistotti, Jason Brown, Michael Witbrock

机构 * University of Auckland(奥克兰大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Presented at https://brigap-workshop.github.io/ Information to be updated upon publication of proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06001 2025-10-08 cs.CL 85%

Exploring Gaps in the APS: Direct Minimal Pair Analysis in LLM Syntactic Assessments

Timothy Pistotti, Jason Brown, Michael Witbrock

机构 * University of Auckland(奥克兰大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Presented at the https://brigap-workshop.github.io/ Information to be updated after publication of proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15436 2025-10-08 cs.HC cs.AI 85%

Ads that Talk Back: Implications and Perceptions of Injecting Personalized Advertising into LLM Chatbots

Brian Jay Tang, Kaiwen Sun, Noah T. Curran, Florian Schaub, Kang G. Shin

机构 * University of Michigan(密歇根大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Journal ref Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies 2025, (UbiComp)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05605 2025-10-08 cs.CR cs.AI 85%

AutoPentester: An LLM Agent-based Framework for Automated Pentesting

Yasod Ginige, Akila Niroshan, Sajal Jain, Suranga Seneviratne

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments IEEE TrustCom 2025 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05139 2025-10-08 cs.CL 85%

NLD-LLM: A systematic framework for evaluating small language transformer models on natural language description

Hamed Jelodar, Mohammad Meymani, Parisa Hamedi, Tochukwu Emmanuel Nwankwo, Samita Bai, Roozbeh Razavi-Far, Ali A. Ghorbani

机构 * Faculty of Computer Science(计算机科学学院) University of New Brunswick(新不伦瑞克大学)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18122 2025-10-08 cs.AI cs.CL 85%

GAUSS: Benchmarking Structured Mathematical Skills for Large Language Models

Yue Zhang, Jiaxin Zhang, Qiuyu Ren, Tahsin Saffat, Xiaoxuan Liu, Zitong Yang, Banghua Zhu, Yi Ma

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

Comments 120 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06104 2025-10-08 cs.SE 85%

Explaining Code Risk in OSS: Towards LLM-Generated Fault Prediction Interpretations

Elijah Kayode Adejumo, Brittany Johnson

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02418 2025-10-08 cs.AI cs.LG 84%

BrowserArena: Evaluating LLM Agents on Real-World Web Navigation Tasks

Sagnik Anupam, Davis Brown, Shuo Li, Eric Wong, Hamed Hassani, Osbert Bastani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏