arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-29 至 2025-10-29 共收录 186 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 30 篇

2510.24115 2025-10-29 cs.AI cs.LG 76%

HistoLens: An Interactive XAI Toolkit for Verifying and Mitigating Flaws in Vision-Language Models for Histopathology

Sandeep Vissapragada, Vikrant Sahu, Gagan Raj Gupta, Vandita Singh

机构 * Indian Institute of Technology(印度理工学院) All India Institute of Medical Sciences(全印度医学科学研究所)

专题命中 推理与问题求解 :language model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24706 2025-10-29 cs.CL cs.AI cs.HC cs.SE 73%

ComboBench: Can LLMs Manipulate Physical Devices to Play Virtual Reality Games?

Shuqing Li, Jiayi Yan, Chenyu Niu, Jen-tse Huang, Yun Peng, Wenxuan Wang, Yepang Liu, Michael R. Lyu

机构 * Chinese University of Hong Kong(香港中文大学) Southern University of Science and Technology(南方科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23870 2025-10-29 cs.CL cs.AI 73%

OraPlan-SQL: A Planning-Centric Framework for Complex Bilingual NL2SQL Reasoning

Marianne Menglin Liu, Sai Ashish Somayajula, Syed Fahad Allam Shah, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01161 2025-10-29 cs.LG cs.AI 73%

Prosperity before Collapse: How Far Can Off-Policy RL Reach with Stale Data on LLMs?

Haizhong Zheng, Jiawei Zhao, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta AI

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24514 2025-10-29 cs.CV cs.CL 70%

Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs

Huanyu Zhang, Wenshan Wu, Chengzu Li, Ning Shang, Yan Xia, Yangyu Huang, Yifan Zhang, Li Dong, Zhang Zhang, Liang Wang, Tieniu Tan, Furu Wei

机构 * MSR(微软研究院) UCAS(中国科学院自动化研究所) CASIA(中国科学院自动化研究所) Cambridge(剑桥大学) NJU(南京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24446 2025-10-29 cs.CL cs.CV 70%

SPARTA: Evaluating Reasoning Segmentation Robustness through Black-Box Adversarial Paraphrasing in Text Autoencoder Latent Space

Viktoriia Zinkovich, Anton Antonov, Andrei Spiridonov, Denis Shepelev, Andrey Moskalenko, Daria Pugacheva, Elena Tutubalina, Andrey Kuznetsov, Vlad Shakhuro

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24397 2025-10-29 cs.AI 70%

APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training

Jiarui Qin, Yunjia Xi, Junjie Huang, Renting Rui, Di Yin, Weiwen Liu, Yong Yu, Weinan Zhang, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :LLM(abstract);post-training(abstract);分类 cs.AI

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17102 2025-10-29 cs.CV 67%

GRASP: Geospatial pixel Reasoning viA Structured Policy learning

Chengjie Jiang, Yunqi Zhou, Jiafeng Yan, Jing Li, Jiayang Li, Yue Zhou, Hongjie He, Jonathan Li

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Information, Central University of Finance and Economics(中央财经大学信息学院) Key Laboratory of Geographic Information Science (Ministry of Education), East China Normal University(教育部地理信息科学重点实验室,华东师范大学) School of Electronic and Computer Engineering, Peking University(北京大学电子工程学院) Department of Geography and Environmental Management, University of Waterloo(滑铁卢大学地理与环境管理系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23966 2025-10-29 cs.LG cs.SE 57%

A Pragmatic Way to Measure Chain-of-Thought Monitorability

Scott Emmons, Roland S. Zimmermann, David K. Elson, Rohin Shah

机构 * Google(谷歌)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.LG

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23664 2025-10-29 cs.SE cs.AI 57%

Agentsway -- Software Development Methodology for AI Agents-based Teams

Eranga Bandara, Ross Gore, Xueping Liang, Sachini Rajapakse, Isurunima Kularathne, Pramoda Karunarathna, Peter Foytik, Sachin Shetty, Ravi Mukkamala, Abdul Rahman, Amin Hass, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University(旧 Dominion 大学) Florida International University(佛罗里达国际大学) University of Sri Jayewardenepura(Sri Jayewardenepura 大学) Deloitte & Touche LLP AnaletIQ Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22917 2025-10-29 cs.RO cs.AI 57%

HyPerNav: Hybrid Perception for Object-Oriented Navigation in Unknown Environment

Zecheng Yin, Hao Zhao, Zhen Li

机构 * Future Network of Intelligence Institute(Shenzhen)(智能未来网络研究所(深圳)) Tsinghua University(清华大学) The Chinese University of Hongkong(Shenzhen)(香港大学(深圳))

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22118 2025-10-29 cs.CV cs.AI 57%

GRAID: Enhancing Spatial Reasoning of VLMs Through High-Fidelity Data Generation

Karim Elmaaroufi, Liheng Lai, Justin Svegliato, Yutong Bai, Sanjit A. Seshia, Matei Zaharia

机构 * University of California, Berkeley(加州大学伯克利分校) Models for Embodied and Spatial Harmony(具身与空间和谐模型)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

Comments 22 pages, 3 figures, 3 tables, project page: https://ke7.github.io/graid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17191 2025-10-29 cs.RO cs.AI 57%

SimpleVSF: VLM-Scoring Fusion for Trajectory Prediction of End-to-End Autonomous Driving

Peiru Zheng, Yun Zhao, Zhan Gong, Hong Zhu, Shaohua Wu

机构 * IEIT Systems(IEIT系统)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17939 2025-10-29 cs.CV cs.AI 57%

GEMeX-RMCoT: An Enhanced Med-VQA Dataset for Region-Aware Multimodal Chain-of-Thought Reasoning

Bo Liu, Xiangyu Zhao, Along He, Yidi Chen, Huazhu Fu, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Shenzhen University(深圳大学) West China Hospital of Sichuan University(四川大学华西医院) IHPC, Agency for Science, Technology and Research(科技研究局IHPC)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.AI

Comments Accepted at ACM MM 2025 (also known as GEMeX-ThinkVG)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 47 篇

2510.23875 2025-10-29 cs.HC 92%

Large Language Model Agent Personality and Response Appropriateness: Evaluation by Human Linguistic Experts, LLM-as-Judge, and Natural Language Processing Model

Eswari Jayakumar, Niladri Sekhar Dash, Debasmita Mukherjee

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23948 2025-10-29 cs.LG cs.AI 91%

ChessQA: Evaluating Large Language Models for Chess Understanding

Qianfeng Wen, Zhenwei Tang, Ashton Anderson

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

Comments 33 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01281 2025-10-29 cs.CL cs.AI 90%

Arena-Lite: Efficient and Reliable Large Language Model Evaluation via Tournament-Based Direct Comparisons

Seonil Son, Ju-Min Oh, Heegon Jin, Cheolhun Jang, Jeongbeom Jeong, Kuntae Kim

机构 * NC AI RLWRLD Inc.(RLWRLD公司) Samsung AI Research(三星人工智能研究所) Global AI Platform(全球人工智能平台) Samsung Life Insurance(三星人寿保险)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 8 pages for main body, 19 pages in total

Journal ref EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24013 2025-10-29 cs.AI cs.LG cs.NE math.CO math.OC 90%

Discovering Heuristics with Large Language Models (LLMs) for Mixed-Integer Programs: Single-Machine Scheduling

İbrahim Oğuz Çetinkaya, İ. Esra Büyüktahtakın, Parshin Shojaee, Chandan K. Reddy

机构 * Grado Department of Industrial and Systems Engineering, Virginia Tech, Blacksburg, VA(弗吉尼亚理工大学工业与系统工程系) Department of Computer Science, Virginia Tech, Arlington, VA(弗吉尼亚理工大学计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23941 2025-10-29 cs.CL cs.AI 90%

Auto prompting without training labels: An LLM cascade for product quality assessment in e-commerce catalogs

Soham Satyadharma, Fatemeh Sheikholeslami, Swati Kaul, Aziz Umit Batur, Suleiman A. Khan

机构 * Amazon Catalog AI(亚马逊目录人工智能)

专题命中 评测与基准 :prompting(title,abstract);LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00103 2025-10-29 cs.LG cs.AI physics.chem-ph 90%

Pre-trained knowledge elevates large language models beyond traditional chemical reaction optimizers

Robert MacKnight, Jose Emilio Regio, Jeffrey G. Ethier, Luke A. Baldwin, Gabe Gomes

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24337 2025-10-29 cs.AI cs.SI 88%

Generative Large Language Models (gLLMs) in Content Analysis: A Practical Guide for Communication Research

Daria Kravets-Meinke, Hannah Schmid-Petri, Sonja Niemann, Ute Schmid

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17100 2025-10-29 cs.CL 88%

Any Large Language Model Can Be a Reliable Judge: Debiasing with a Reasoning-based Bias Detector

Haoyan Yang, Runxue Bao, Cao Xiao, Jun Ma, Parminder Bhatia, Shangqian Gao, Taha Kass-Hout

机构 * New York University(纽约大学) GE Healthcare(通用电气医疗) Florida State University(佛罗里达州立大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

Comments Accepted at NeurIPS 2025 (Camera-Ready Version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23893 2025-10-29 cs.SE cs.AI 85%

Evaluating the effectiveness of LLM-based interoperability

Rodrigo Falcão, Stefan Schweitzer, Julien Siebert, Emily Calvet, Frank Elberzhager

机构 * Fraunhofer IESE(弗劳恩霍夫研究所IESE)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15355 2025-10-29 cs.CL 85%

SANSKRITI: A Comprehensive Benchmark for Evaluating Language Models' Knowledge of Indian Culture

Arijit Maji, Raghvendra Kumar, Akash Ghosh, Anushka, Sriparna Saha

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna(印度理工学院帕纳布分校计算机科学与工程系) Department of Computer Science, Banasthali Vidyapeeth University(班斯塔利大学计算机科学系)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.CL

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24367 2025-10-29 cs.SE 85%

LLM-as-a-Judge for Software Engineering: Literature Review, Vision, and the Road Ahead

Junda He, Jieke Shi, Terry Yue Zhuo, Christoph Treude, Jiamou Sun, Zhenchang Xing, Xiaoning Du, David Lo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24438 2025-10-29 cs.CL cs.AI cs.CY cs.MA 84%

Can LLMs Write Faithfully? An Agent-Based Evaluation of LLM-generated Islamic Content

Abdullah Mushtaq, Rafay Naeem, Ezieddin Elmahjub, Ibrahim Ghaznavi, Shawqi Al-Maliki, Mohamed Abdallah, Ala Al-Fuqaha, Junaid Qadir

机构 * Information Technology University(信息科技大学) Qatar University(卡塔尔大学) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: 5th Muslims in Machine Learning (MusIML) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23921 2025-10-29 cs.CL cs.LG 84%

Breaking the Benchmark: Revealing LLM Bias via Minimal Contextual Augmentation

Kaveh Eskandari Miandoab, Mahammed Kamruzzaman, Arshia Gharooni, Gene Louis Kim, Vasanth Sarathy, Ninareh Mehrabi

机构 * Tufts University(塔夫茨大学) University of South Florida(佛罗里达州立大学) Sharif University of Technology(谢赫·穆吉布技术大学) Meta Resolution(解决方案)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00063 2025-10-29 physics.chem-ph cs.AI 83%

MolErr2Fix: Benchmarking LLM Trustworthiness in Chemistry via Modular Error Detection, Localization, Explanation, and Revision

Yuyang Wu, Jinhui Ye, Shuhao Zhang, Lu Dai, Yonatan Bisk, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments 9 pages

Journal ref EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24430 2025-10-29 cs.IR 82%

From Time and Place to Preference: LLM-Driven Geo-Temporal Context in Recommendations

Yejin Kim, Shaghayegh Agah, Mayur Nankani, Neeraj Sharma, Feifei Peng, Maria Peifer, Sardar Hamidian, H Howie Huang

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08386 2025-10-29 cs.CY 82%

Banal Deception Human-AI Ecosystems: A Study of People's Perceptions of LLM-generated Deceptive Behaviour

Xiao Zhan, Yifan Xu, Noura Abdi, Joe Collenette, Ruba Abu-Salma, Stefan Sarkadi

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

Journal ref Journal of Artificial Intelligence Research84, Article 11(October 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏