arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-15 至 2025-10-15 共收录 213 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 39 篇

2510.12157 2025-10-15 cs.LG 77%

Self-Verifying Reflection Helps Transformers with CoT Reasoning

Zhongwei Yu, Wannian Xia, Xue Yan, Bo Xu, Haifeng Zhang, Yali Du, Jun Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05933 2025-10-15 cs.AI 77%

MapAgent: A Hierarchical Agent for Geospatial Reasoning with Dynamic Map Tool Integration

Md Hasebul Hasan, Mahir Labib Dihan, Tanzima Hashem, Mohammed Eunus Ali, Md Rizwan Parvez

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 27 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07140 2025-10-15 cs.AI 77%

Can Graph Descriptive Order Affect Solving Graph Problems with LLMs?

Yuyao Ge, Shenghua Liu, Baolong Bi, Yiwei Wang, Lingrui Mei, Wenjie Feng, Lizhe Chen, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校) SAIDS, University of Science and Technology of China(中国科学技术大学SAIDS) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted to ACL 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11838 2025-10-15 cs.SE 75%

Lingxi: Repository-Level Issue Resolution Framework Enhanced by Procedural Knowledge Guided Scaling

Xu Yang, Jiayuan Zhou, Michael Pacheco, Wenhan Zhu, Pengfei He, Shaowei Wang, Kui Liu, Ruiqi Pan

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11986 2025-10-15 cs.CL cs.AI 73%

Conjecturing: An Overlooked Step in Formal Mathematical Reasoning

Jasivan Alex Sivakumar, Philipp Borchert, Ronald Cardenas, Gerasimos Lampouras

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11944 2025-10-15 cs.CL cs.AI 73%

TopoAlign: A Framework for Aligning Code to Math via Topological Decomposition

Yupei Li, Philipp Borchert, Gerasimos Lampouras

机构 * Imperial College London(帝国学院伦敦分校) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12693 2025-10-15 cs.AI 70%

ERA: Transforming VLMs into Embodied Agents via Embodied Prior Learning and Online Reinforcement Learning

Hanyang Chen, Mark Zhao, Rui Yang, Qinwei Ma, Ke Yang, Jiarui Yao, Kangrui Wang, Hao Bai, Zhenhailong Wang, Rui Pan, Mengchao Zhang, Jose Barreiros, Aykut Onol, ChengXiang Zhai, Heng Ji, Manling Li, Huan Zhang, Tong Zhang

机构 * UIUC(伊利诺伊大学香槟分校) Northwestern University(西北大学) Toyota Research Institute(丰田研究院)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12409 2025-10-15 cs.AI 70%

PricingLogic: Evaluating LLMs Reasoning on Complex Tourism Pricing Tasks

Yunuo Liu, Dawei Zhu, Zena Al-Khalili, Dai Cheng, Yanjun Chen, Dietrich Klakow, Wei Zhang, Xiaoyu Shen

机构 * Hunan University(湖南大学) Saarland University, Saarland Informatics Campus(萨尔兰大学,萨尔兰信息技术校区) Ningbo Key Laboratory of Spatial Intelligence and Digital, Derivative Institute of Digital Twin, EIT(宁波空间智能与数字关键实验室,数字孪生衍生研究所,EIT) Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10168 2025-10-15 cs.AI 70%

Concise Reasoning in the Lens of Lagrangian Optimization

Chengqian Gao, Haonan Li, Taylor W. Killian, Jianshu She, Renxi Wang, Liqun Ma, Zhoujun Cheng, Shibo Hao, Zhiqiang Xu

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10446 2025-10-15 cs.CL 70%

DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL

Rui Lu, Zhenyu Hou, Zihan Wang, Hanchen Zhang, Xiao Liu, Yujiang Li, Shi Feng, Jie Tang, Yuxiao Dong

机构 * Tsinghua University(清华大学) Northeastern University(东北大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18943 2025-10-15 cs.CL 70%

MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems

Xuanming Zhang, Yuxuan Chen, Samuel Yeh, Sharon Li

机构 * Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00757 2025-10-15 cs.CR cs.AI cs.NE 70%

AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-Improvement

J Rosser, Jakob Foerster

机构 * University of Oxford(牛津大学) FLAIR University of Oxford(牛津大学FLAIR)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04587 2025-10-15 cs.CV 67%

Pathology-CoT: Learning Visual Chain-of-Thought Agent from Expert Whole Slide Image Diagnosis Behavior

Sheng Wang, Ruiming Wu, Charles Herndon, Yihang Liu, Shunsuke Koga, Jeanne Shen, Zhi Huang

机构 * Department of Pathology and Laboratory Medicine, University of Pennsylvania(病理学与实验室医学系,宾夕法尼亚大学) Department of Biostatistics, Epidemiology & Informatics, University of Pennsylvania(生物统计学、流行病学与信息学系,宾夕法尼亚大学) Department of Pathology, University of California at San Francisco(病理学系,加州大学旧金山分校) Department of Pathology, Stanford University(病理学系,斯坦福大学) Department of Electrical and System Engineering, University of Pennsylvania(电气与系统工程系,宾夕法尼亚大学)

专题命中 推理与问题求解 :LLM(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12200 2025-10-15 cs.CR cs.CL 57%

HackWorld: Evaluating Computer-Use Agents on Exploiting Web Application Vulnerabilities

Xiaoxue Ren, Penghao Jiang, Kaixin Li, Zhiyong Huang, Xiaoning Du, Jiaojiao Jiang, Zhenchang Xing, Jiamou Sun, Terry Yue Zhuo

机构 * Zhejiang University(浙江大学) University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学) Monash University(墨尔本大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12185 2025-10-15 cs.CL cs.SD 57%

Not in Sync: Unveiling Temporal Bias in Audio Chat Models

Jiayu Yao, Shenghua Liu, Yiwei Wang, Rundong Cheng, Lingrui Mei, Baolong Bi, Zhen Xiong, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校) Beijing University of Posts and Telecommunications(北京邮电大学) University of Southern California(南加州大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10207 2025-10-15 cs.AI 57%

Adaptive Dual Reasoner: Large Reasoning Models Can Think Efficiently by Hybrid Reasoning

Yujian Zhang, Keyu Chen, Zhifeng Shen, Ruizhi Qiao, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.AI

Comments Accepted to NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00378 2025-10-15 cs.AI cs.CV 57%

CoRGI: Verified Chain-of-Thought Reasoning with Post-hoc Visual Grounding

Shixin Yi, Lin Shang

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

Comments The paper is not yet mature and needs further improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25026 2025-10-15 cs.CV 50%

GeoVLM-R1: Reinforcement Fine-Tuning for Improved Remote Sensing Reasoning

Mustansar Fiaz, Hiyam Debary, Paolo Fraccaro, Danda Paudel, Luc Van Gool, Fahad Khan, Salman Khan

机构 * IBM Research(IBM研究院) INSAIT ETH Zürich(苏黎世联邦理工学院) MBZUAI(穆斯林人工智能研究所) Linköping University(林雪平大学) ANU Australia(澳大利亚国立大学)

专题命中 推理与问题求解 :language model(abstract)

Comments Tables 6 and Figures 8. https://mustansarfiaz.github.io/GeoVLM-R1/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 54 篇

2509.22926 2025-10-15 cs.CL cs.AI 90%

Large language models management of medications: three performance analyses

Kelli Henry, Steven Xu, Kaitlin Blotske, Moriah Cargile, Erin F. Barreto, Brian Murray, Susan Smith, Seth R. Bauer, Xingmeng Zhao, Adeleine Tilley, Yanjun Gao, Tianming Liu, Sunghwan Sohn, Andrea Sikora

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12702 2025-10-15 cs.SE cs.AI cs.PL 89%

Beyond Postconditions: Can Large Language Models infer Formal Contracts for Automatic Software Verification?

Cedric Richter, Heike Wehrheim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16804 2025-10-15 cs.MA cs.AI 89%

Multi-Agent Autonomous Driving Systems with Large Language Models: A Survey of Recent Advances

Yaozu Wu, Dongyuan Li, Yankai Chen, Renhe Jiang, Henry Peng Zou, Wei-Chieh Huang, Yangning Li, Liancheng Fang, Zhen Wang, Philip S. Yu

机构 * The University of Tokyo(东京大学) Cornell University(康奈尔大学) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09043 2025-10-15 cs.AI 88%

Humanoid Artificial Consciousness Designed with Large Language Model Based on Psychoanalysis and Personality Theory

Sang Hun Kim, Jongmin Lee, Dongkyu Park, So Young Lee, Yosep Chong

机构 * Hanyang University(翰阳大学) Miami University(迈阿密大学) The Catholic University of Korea College of Medicine(韩国天主教大学医学院) Artificial Consciousness Lab, MODULABS(意识实验室,MODULABS)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 41 pages, 6 figures. Accepted and published to Cognitive Systems Research, 2025

Journal ref Cognitive Systems Research Volume 94, December 2025, 101392

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11742 2025-10-15 cs.CY 88%

The Ethics Engine: A Modular Pipeline for Accessible Psychometric Assessment of Large Language Models

Jake Van Clief, Constantine Kyritsopoulos

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 18 pages, 2 figures. Code available at https://github.com/RinDig/GPTmetrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10367 2025-10-15 cs.CV 88%

Contrast Sensitivity in Multimodal Large Language Models: A Psychophysics-Inspired Evaluation

Pablo Hernández-Cámara, Alexandra Gomez-Villa, Jose Manuel Jaén-Lorites, Jorge Vila-Tomás, Valero Laparra, Jesus Malo

机构 * Image Processing Lab, Universitat de València, Spain(瓦伦西亚大学图像处理实验室) Computer Vision Center, Spain(西班牙计算机视觉中心) Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学) Center for Biomaterials and Tissue Engineering, Universitat Politecnica de Valencia, Spain(瓦伦西亚理工大学生物材料与组织工程中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20996 2025-10-15 cs.AI 87%

ChatThero: An LLM-Supported Chatbot for Behavior Change and Therapeutic Support in Addiction Recovery

Junda Wang, Zonghai Yao, Lingxi Li, Junhui Qian, Zhichao Yang, Hong Yu

机构 * Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(VA Bedford Health Care 医疗组织与实施研究中心) Manning College of Information and Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校信息与计算机科学学院) Miner School of Computer and Information Sciences, University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校计算机与信息科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);language agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12095 2025-10-15 cs.CV 87%

IL3D: A Large-Scale Indoor Layout Dataset for LLM-Driven 3D Scene Generation

Wenxu Zhou, Kaixuan Nie, Hang Du, Dong Yin, Wei Huang, Siqiang Guo, Xiaobo Zhang, Pengbo Hu

机构 * University of Science and Technology of China(中国科学技术大学) Songying Technology(宋英科技)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

Comments 9 pages main paper; 15 pages references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11905 2025-10-15 cs.CL cs.LG 86%

LLM Knowledge is Brittle: Truthfulness Representations Rely on Superficial Resemblance

Patrick Haller, Mark Ibrahim, Polina Kirichenko, Levent Sagun, Samuel J. Bell

机构 * FAIR at Meta(Meta 的 FAIR 研究所) University of Zurich(苏黎世大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26072 2025-10-15 cs.CL 85%

The Silent Judge: Unacknowledged Shortcut Bias in LLM-as-a-Judge

Arash Marioriyad, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 9 Pages, 5 Tables, 1 Figures

Journal ref 39th Conference on Neural Information Processing System, 2025, Workshop: Reliable ML from Unreliable Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12110 2025-10-15 cs.CL cs.AI 85%

Deep Associations, High Creativity: A Simple yet Effective Metric for Evaluating Large Language Models

Ziliang Qiu, Renfen Hu

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Beijing Normal University(北京师范大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07214 2025-10-15 cs.CV cs.AI cs.CL 84%

Exploring the Frontier of Vision-Language Models: A Survey of Current Methodologies and Future Directions

Akash Ghosh, Arkadeep Acharya, Sriparna Saha, Vinija Jain, Aman Chadha

机构 * Department of Computer Science and Engineering, IIT Patna, India(印度帕纳大学计算机科学与工程系) Stanford University(斯坦福大学) Amazon AI(亚马逊人工智能) Indian Institute of Technology Patna, India(印度帕纳大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments One of the first survey on Visual Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏