arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-01 至 2025-08-01 共收录 132 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 23 篇

2507.23589 2025-08-01 cs.RO cs.AI 83%

Can LLM-Reasoning Models Replace Classical Planning? A Benchmark Study

Kai Goebel, Patrik Zips

机构 * Center for Vision, Automation & Control(视觉、自动化与控制中心) AIT Austrian Institute of Technology GmbH(奥地利技术研究院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23135 2025-08-01 cs.CL 79%

ISO-Bench: Benchmarking Multimodal Causal Reasoning in Visual-Language Models through Procedural Plans

Ananya Sadana, Yash Kumar Lal, Jiawei Zhou

机构 * Stony Brook University(石溪大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22928 2025-08-01 cs.CL cs.AI 79%

How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding

Xi Chen, Aske Plaat, Niki van Stein

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23429 2025-08-01 cs.AI cs.DB cs.ET cs.HC cs.MA 78%

Chatting with your ERP: A Recipe

Jorge Ruiz Gómez, Lidia Andrés Susinos, Jorge Alamo Olivé, Sonia Rey Osorno, Manuel Luis Gonzalez Hernández

机构 * Instituto Tecnológico de Castilla y León(卡斯蒂利亚-莱昂技术学院)

专题命中 推理与问题求解 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.AI

Comments 11 pages, includes 3 tables summarizing schema and model performance. Submitted on July 31, 2025. Targets integration of LLM agents with ERP systems using open-weight models and Ollama deployment

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06474 2025-08-01 physics.ao-ph 78%

Climate in a Bottle: Towards a Generative Foundation Model for the Kilometer-Scale Global Atmosphere

Noah D. Brenowitz, Tao Ge, Akshay Subramaniam, Peter Manshausen, Aayush Gupta, David M. Hall, Morteza Mardani, Arash Vahdat, Karthik Kashinath, Michael S. Pritchard

专题命中 推理与问题求解 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15135 2025-08-01 cs.RO 78%

Controllable Traffic Simulation through LLM-Guided Hierarchical Reasoning and Refinement

Zhiyuan Liu, Leheng Li, Yuning Wang, Haotian Lin, Hao Cheng, Zhizhe Liu, Lei He, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动学院) Artificial Intelligence Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)人工智能研究部) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 推理与问题求解 :LLM(title,abstract)

Comments Accepted by IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23540 2025-08-01 cs.RO cs.AI cs.CV 77%

A Unified Perception-Language-Action Framework for Adaptive Autonomous Driving

Yi Zhang, Erik Leo Haß, Kuo-Yi Chao, Nenad Petrovic, Yinglei Song, Chengdong Wu, Alois Knoll

机构 * Chair of Robotics, Artificial Intelligence and Embedded Systems Technical University of Munich (TUM)(机器人、人工智能与嵌入系统教授席 Technical University of Munich)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22955 2025-08-01 cs.SI cs.LG 77%

LLMs Between the Nodes: Community Discovery Beyond Vectors

Ekta Gujral, Apurva Sinha

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23772 2025-08-01 cs.CV 75%

SeqAffordSplat: Scene-level Sequential Affordance Reasoning on 3D Gaussian Splatting

Di Li, Jie Feng, Jiahao Chen, Weisheng Dong, Guanbin Li, Yuhui Zheng, Mingtao Feng, Guangming Shi

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23478 2025-08-01 cs.CV 75%

3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding

Ting Huang, Zeyu Zhang, Hao Tang

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23348 2025-08-01 cs.SE cs.CL cs.LG 73%

SWE-Debate: Competitive Multi-Agent Debate for Software Issue Resolution

Han Li, Yuling Shi, Shaoxin Lin, Xiaodong Gu, Heng Lian, Xin Wang, Yantao Jia, Tao Huang, Qianxiang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei(华为) Xidian University(西安电子科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Our code and data are available at https://github.com/YerbaPage/SWE-Debate

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22607 2025-08-01 cs.CV cs.AI cs.CL 73%

VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning

Ruifeng Yuan, Chenghao Xiao, Sicong Leng, Jianyu Wang, Long Li, Weiwen Xu, Hou Pong Chan, Deli Zhao, Tingyang Xu, Zhongyu Wei, Hao Zhang, Yu Rong

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(虎盘实验室) Fudan University(复旦大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 21 pages, 5 figures, 6 tables. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14928 2025-08-01 cs.AI cs.CE cs.CL cs.CY cs.HC 73%

EducationQ: Evaluating LLMs' Teaching Capabilities Through Multi-Agent Dialogue Framework

Yao Shi, Rongkeng Liang, Yong Xu

机构 * South China University of Technology(华南理工大学) Education Innovation Research Institute of Guangdong(广东教育创新研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Paper URL: https://aclanthology.org/2025.acl-long.1576 ;Presentation Video: https://www.youtube.com/watch?v=j63ooKE50I0

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) (2025) 32799-32828

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23488 2025-08-01 cs.AI 70%

Causal Reasoning in Pieces: Modular In-Context Learning for Causal Discovery

Kacper Kadziolka, Saber Salehkaleybar

机构 * Leiden Institute of Advanced Computer Science (LIACS)(莱顿先进计算机科学研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20451 2025-08-01 cs.RO 67%

CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance

Jinming Li, Yichen Zhu, Zhibin Tang, Junjie Wen, Minjie Zhu, Xiaoyu Liu, Chengmeng Li, Ran Cheng, Yaxin Peng, Yan Peng, Feifei Feng

机构 * Shanghai University(上海大学) Midea Group(美的集团) East China Normal University(华东师范大学)

专题命中 推理与问题求解 :foundation model(abstract);prompting(abstract)

Comments Project webpage is available at https://chain-of-affordance.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22958 2025-08-01 cs.CV cs.AI cs.LG 62%

CHECK-MAT: Checking Hand-Written Mathematical Answers for the Russian Unified State Exam

Ruslan Khrulev

机构 * Moscow State University(莫斯科国立大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

Comments 15 pages, 3 figures, 10 tables. Code is available at: https://github.com/Karifannaa/Auto-check-EGE-math

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23698 2025-08-01 cs.RO cs.AI 57%

Scalable Multi-Task Reinforcement Learning for Generalizable Spatial Intelligence in Visuomotor Agents

Shaofei Cai, Zhancun Mu, Haiwen Xia, Bowei Zhang, Anji Liu, Yitao Liang

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23407 2025-08-01 cs.CL 57%

Beyond Passive Critical Thinking: Fostering Proactive Questioning to Enhance Human-AI Collaboration

Ante Wang, Yujie Lin, Jingyao Liu, Suhang Wu, Hao Liu, Xinyan Xiao, Jinsong Su

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) Department of Digital Media Technology, Xiamen University, China(厦门大学数字媒体技术系) Baidu Inc., Beijing, China(百度公司)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23308 2025-08-01 eess.SY cs.SY 50%

A Framework for Ethical Decision-Making in Automated Vehicles through Human Reasons-based Supervision

Lucas Elbert Suryana, Saeed Rahmani, Simeon Craig Calvert, Arkady Zgonnikov, Bart van Arem

专题命中 推理与问题求解 :prompting(abstract)

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 27 篇

2507.22947 2025-08-01 cs.CY cs.CL cs.LG 90%

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios

Shou'ang Wei, Xinyun Wang, Shuzhen Bi, Jian Chen, Ruijia Li, Bo Jiang, Xin Lin, Min Zhang, Yu Song, BingDong Li, Aimin Zhou, Hao Hao

机构 * Shanghai Innavation Institute(上海创新研究院) Shanghai Institute of AI for Education(上海人工智能教育研究院) Department of Educational Information Technology(教育信息技术系) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18199 2025-08-01 cs.CL cs.AI cs.CY cs.HC 90%

Prompt Engineering Techniques for Mitigating Cultural Bias Against Arabs and Muslims in Large Language Models: A Systematic Review

Bushra Asseri, Estabrag Abdelaziz, Areej Al-Wabil

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments Research is incomplete

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23370 2025-08-01 cs.SE cs.AI 87%

Trae Agent: An LLM-based Agent for Software Engineering with Test-time Scaling

Trae Research Team, Pengfei Gao, Zhao Tian, Xiangxin Meng, Xinchen Wang, Ruida Hu, Yuanan Xiao, Yizhou Liu, Zhao Zhang, Junjie Chen, Cuiyun Gao, Yun Lin, Yingfei Xiong, Chao Peng, Xia Liu

机构 * Trae Research(Trae研究)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Pengfei Gao and Zhao Tian contributed equally to this technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22937 2025-08-01 cs.CL cs.AI 86%

CoE-Ops: Collaboration of LLM-based Experts for AIOps Question-Answering

Jinkun Zhao, Yuanshuai Wang, Xingjian Zhang, Ruibo Chen, Xingchuang Liao, Junle Wang, Lei Huang, Kui Zhang, Wenjun Wu

机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University(SKLCCSE,人工智能学院,北航) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(未来区块链与隐私计算先进创新中心,北航)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23087 2025-08-01 cs.SE cs.AI 85%

On LLM-Assisted Generation of Smart Contracts from Business Processes

Fabian Stiehle, Hans Weytjens, Ingo Weber

机构 * Technical University of Munich, School of CIT, Germany(慕尼黑技术大学计算机信息学院) Fraunhofer Gesellschaft, Munich, Germany(弗劳恩霍夫协会)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted at the Workshop on Distributed Ledger Technologies in Business Process Management, At the International Conference for Business Process Management (BPM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23694 2025-08-01 cs.MA cs.AI 83%

A survey of multi-agent geosimulation methodologies: from ABM to LLM

Virginia Padilla, Jacinto Dávila

机构 * Departamento de Ciencia y Tecnología, Universidad Nacional Experimental de Guayana(科学与技术系,圭亚那国家实验大学) CeSiMo, Facultad de Ingeniería, Universidad de los Andes(CeSiMo,工程学院,安第斯大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments 20 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23740 2025-08-01 cs.CL cs.AI cs.LG 80%

Rule2Text: Natural Language Explanation of Logical Rules in Knowledge Graphs

Nasim Shirvani-Mahdavi, Devin Wingfield, Amin Ghasemi, Chengkai Li

机构 * University of Texas at Arlington(德克萨斯理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22956 2025-08-01 cs.LG cs.HC 79%

LLM-Assisted Cheating Detection in Korean Language via Keystrokes

Dong Hyun Roh, Rajesh Kumar, An Ngo

机构 * Bucknell University(布克内尔大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

Comments This paper has 11 pages, 6 figures, 2 tables, and has been accepted for publication at IEEE-IJCB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16060 2025-08-01 cs.CL 79%

Vision-Language Models Are Not Pragmatically Competent in Referring Expression Generation

Ziqiao Ma, Jing Ding, Xuejun Zhang, Dezhi Luo, Jiahe Ding, Sihan Xu, Yuchen Huang, Run Peng, Joyce Chai

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments COLM 2025 & CVinW @ CVPR 2025 (Spotlight). Homepage: https://vlm-reg.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23248 2025-08-01 cs.CL cs.LG 79%

Evaluating LLMs' Multilingual Capabilities for Bengali: Benchmark Creation and Performance Analysis

Shimanto Bhowmik, Tawsif Tashwar Dipto, Md Sazzad Islam, Sheryl Hsu, Tahsin Reasat

机构 * Rochester Institute of Technology(罗切斯特技术研究院) Islamic University of Technology(伊斯兰技术大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22902 2025-08-01 cs.HC cs.AI cs.CL cs.MA 79%

Toward the Autonomous AI Doctor: Quantitative Benchmarking of an Autonomous Agentic AI Versus Board-Certified Clinicians in a Real World Setting

Hashim Hayat, Maksim Kudrautsau, Evgeniy Makarov, Vlad Melnichenko, Tim Tsykunou, Piotr Varaksin, Matt Pavelle, Adam Z. Oskowitz

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏