arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-07 至 2025-10-07 共收录 382 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 55 篇

2510.04039 2025-10-07 cs.CV cs.AI 70%

\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding

Bin Lei, Nuo Xu, Ali Payani, Mingyi Hong, Chunhua Liao, Yu Cao, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) Cisco Research(思科研究) Lawrence Livermore National Labs(劳伦斯利弗莫尔国家实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03863 2025-10-07 cs.AI cs.CR 70%

Spatial CAPTCHA: Generatively Benchmarking Spatial Reasoning for Human-Machine Differentiation

Arina Kharlamova, Bowei He, Chen Ma, Xue Liu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Submitted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03829 2025-10-07 cs.NI cs.AI 70%

A4FN: an Agentic AI Architecture for Autonomous Flying Networks

André Coelho, Pedro Ribeiro, Helder Fontes, Rui Campos

机构 * FCT – Fundação para a Ciência e a Tecnologia, I.P.(葡萄牙科学与技术基金会)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments This paper has been accepted for presentation in the Auto ML for Zero-Touch Network Management Workshop (WS04-01) at the IEEE International Symposium on Personal, Indoor and Mobile Radio Communications (PIMRC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24251 2025-10-07 cs.CV cs.CL 70%

Latent Visual Reasoning

Bangzheng Li, Ximeng Sun, Jiang Liu, Ze Wang, Jialian Wu, Xiaodong Yu, Hao Chen, Emad Barsoum, Muhao Chen, Zicheng Liu

机构 * University of California, Davis(加州大学戴维斯分校) Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16929 2025-10-07 cs.CL 70%

K-DeCore: Facilitating Knowledge Transfer in Continual Structured Knowledge Reasoning via Knowledge Decoupling

Yongrui Chen, Yi Huang, Yunchang Liu, Shenyu Zhang, Junhao He, Tongtong Wu, Guilin Qi, Tianxing Wu

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及 interdisciplinary 应用关键实验室(东南大学)) China Mobile Research Institute(中国移动研究院) Department of Data Science & AI, Monash University, Australia(莫纳什大学数据科学与人工智能系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted in Neurips 2025 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13003 2025-10-07 cs.AI 70%

EvolMathEval: Towards Evolvable Benchmarks for Mathematical Reasoning via Evolutionary Testing

Shengbo Wang, Mingwei Liu, Zike Li, Anji Li, Yanlin Wang, Xin Peng, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) Fudan University(复旦大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09123 2025-10-07 cs.AI cs.CV 70%

OpenCUA: Open Foundations for Computer-Use Agents

Xinyuan Wang, Bowen Wang, Dunjie Lu, Junlin Yang, Tianbao Xie, Junli Wang, Jiaqi Deng, Xiaole Guo, Yiheng Xu, Chen Henry Wu, Zhennan Shen, Zhuokai Li, Ryan Li, Xiaochuan Li, Junda Chen, Boyuan Zheng, Peihang Li, Fangyu Lei, Ruisheng Cao, Yeqiao Fu, Dongchan Shin, Martin Shin, Jiarui Hu, Yuyan Wang, Jixuan Chen, Yuxiao Ye, Danyang Zhang, Dikang Du, Hao Hu, Huarong Chen, Zaida Zhou, Haotian Yao, Ziwei Chen, Qizheng Gu, Yipu Wang, Heng Wang, Diyi Yang, Victor Zhong, Flood Sung, Y. Charles, Zhilin Yang, Tao Yu

机构 * XLANG Lab, The University of Hong Kong(香港大学XLANG实验室) Moonshot AI Stanford University(斯坦福大学) University of Waterloo(滑铁卢大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);分类 cs.AI

Comments Updata author list, modify first page format, correct typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04493 2025-10-07 cs.HC 67%

Multi-Hop Question Answering: When Can Humans Help, and Where do They Struggle?

Jinyan Su, Claire Cardie, Jennifer Healey

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04364 2025-10-07 cs.HC 67%

Reflection Before Action: Designing a Framework for Quantifying Thought Patterns for Increased Self-awareness in Personal Decision Making

Morita Tarvirdians, Senthil Chandrasegaran, Hayley Hung, Catholijn M. Jonker, Catharine Oertel

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00413 2025-10-07 cs.CV 67%

PAL-UI: Planning with Active Look-back for Vision-Based GUI Agents

Zikang Liu, Junyi Li, Wayne Xin Zhao, Dawei Gao, Yaliang Li, Ji-rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学全球化人工智能学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12974 2025-10-07 cs.IR 67%

Learning Refined Document Representations for Dense Retrieval via Deliberate Thinking

Yifan Ji, Zhipeng Xu, Zhenghao Liu, Yukun Yan, Shi Yu, Yishan Li, Zhiyuan Liu, Yu Gu, Ge Yu, Maosong Sun

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03399 2025-10-07 cs.AI cs.CL cs.CY cs.LG 67%

Know Thyself? On the Incapability and Implications of AI Self-Recognition

Xiaoyan Bai, Aryan Shrivastava, Ari Holtzman, Chenhao Tan

机构 * University of Chicago(芝加哥大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Our code is available, see https://github.com/ChicagoHAI/self-recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13141 2025-10-07 cs.CL cs.LG 62%

OptimalThinkingBench: Evaluating Over and Underthinking in LLMs

Pranjal Aggarwal, Seungone Kim, Jack Lanchantin, Sean Welleck, Jason Weston, Ilia Kulikov, Swarnadeep Saha

机构 * FAIR at Meta(Meta 的 FAIR 研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.LG

Comments 30 pages, 10 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03441 2025-10-07 cs.CV cs.AI cs.LG 62%

Spatial-ViLT: Enhancing Visual Spatial Reasoning through Multi-Task Learning

Chashi Mahiul Islam, Oteo Mamo, Samuel Jacob Chacko, Xiuwen Liu, Weikuan Yu

机构 * Florida State University(佛罗里达州立大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03527 2025-10-07 cs.CL 57%

Sample, Align, Synthesize: Graph-Based Response Synthesis with ConGrs

Sayan Ghosh, Shahzaib Saqib Warraich, Dhruv Tarsadiya, Gregory Yauney, Swabha Swayamdipta

机构 * University of Southern California(南加州大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02608 2025-10-07 cs.AI 57%

Mitigating Modal Imbalance in Multimodal Reasoning

Chen Henry Wu, Neil Kale, Aditi Raghunathan

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

Comments 10 pages, 10 figures, CoLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18710 2025-10-07 cs.AI 57%

Autonomous Data Agents: A New Opportunity for Smart Data

Yanjie Fu, Dongjie Wang, Wangyang Ying, Xinyuan Wang, Xiangliang Zhang, Huan Liu, Jian Pei

机构 * Arizona State University(亚利桑那州立大学) University of Kansas(堪萨斯大学) University of Notre Dame(圣母大学) Duke University(杜克大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01862 2025-10-07 cs.RO 50%

ReLI: A Language-Agnostic Approach to Human-Robot Interaction

Linus Nwankwo, Bjoern Ellensohn, Ozan Özdenizci, Elmar Rueckert

机构 * Chair of Cyber-Physical Systems, Technical University of Leoben(技术大学莱博恩首席物理系统 Chair) Institute of Machine Learning and Neural Computation, Graz University of Technology(格拉茨技术大学机器学习与神经计算研究所)

专题命中 推理与问题求解 :foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04873 2025-10-07 cs.RO 50%

Training-free Task-oriented Grasp Generation

Jiaming Wang, Diwen Liu, Jizhuo Chen, Harold Soh

专题命中 推理与问题求解 :language model(abstract)

Comments Jiaming Wang, Diwen Liu, and Jizhuo Chen contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 82 篇

2510.03913 2025-10-07 cs.CL 90%

PsycholexTherapy: Simulating Reasoning in Psychotherapy with Small Language Models in Persian

Mohammad Amin Abbasi, Hassan Naderi

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04400 2025-10-07 cs.CL cs.AI 90%

Large Language Models Preserve Semantic Isotopies in Story Continuations

Marc Cavazza

机构 * University of Stirling(斯特林大学) National Institute of Informatics(日本信息处理研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04032 2025-10-07 cs.CL cs.AI 90%

Small Language Models for Emergency Departments Decision Support: A Benchmark Study

Zirui Wang, Jiajun Wu, Braden Teitge, Jessalyn Holodinsky, Steve Drew

机构 * Department of Electrical and Software Engineering, University of Calgary, Calgary, AB, Canada(电气与软件工程系,卡尔加里大学) Department of Emergency Medicine, University of Calgary, Calgary, AB, Canada(急诊医学系,卡尔加里大学) Rockview General Hospital, Calgary, AB, Canada(罗克维尔医院)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to 2025 IEEE International Conference on Autonomous and Trusted Computing (ATC 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19144 2025-10-07 cs.LG cs.AI 90%

Solar Photovoltaic Assessment with Large Language Model

Muhao Guo, Yang Weng

机构 * Department of Electrical, Computer and Energy Engineering, Arizona State University(电气、计算机与能源工程系,亚利桑那州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

Comments 43 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20115 2025-10-07 cs.DL cs.AI cs.DB 89%

Flexible metadata harvesting for ecology using large language models

Zehao Lu, Thijs L van der Plas, Parinaz Rashidi, W Daniel Kissling, Ioannis N Athanasiadis

机构 * Wageningen University & Research(瓦赫宁根大学与研究学院) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04293 2025-10-07 cs.CL 89%

Equipping Retrieval-Augmented Large Language Models with Document Structure Awareness

Lingnan Xu, Chong Feng, Kaiyuan Zhang, Liu Zhengyong, Wenqiang Xu, Fanqing Meng

机构 * School of Computer Science, Beijing Institute of Technology(计算机学院,北京理工大学) Ant Group(蚂蚁集团) Southeast Academy of Information Technology, Beijing Institute of Technology(信息科技东南学院,北京理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04051 2025-10-07 cs.AI 89%

Toward a unified framework for data-efficient evaluation of large language models

Lele Liao, Qile Zhang, Ruofan Wu, Guanhua Fang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments codes available at https://github.com/Rorschach1989/efficient-lm-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19064 2025-10-07 cs.CL 89%

Can Large Language Models Outperform Non-Experts in Poetry Evaluation? A Comparative Study Using the Consensual Assessment Technique

Piotr Sawicki, Marek Grześ, Dan Brown, Fabrício Góes

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 18 pages, 3 figures. Accepted for publication at the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11625 2025-10-07 cs.CL cs.AI cs.CV cs.LG 89%

MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering

Varun Srivastava, Fan Lei, Srija Mukhopadhyay, Vivek Gupta, Ross Maciejewski

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院) Arizona State University(亚利桑那州立大学) Department of Computer Science(计算机科学系) International Institute of Information Technology(国际信息科技研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published as a conference paper at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23500 2025-10-07 cs.SE cs.CL cs.DL 88%

Identity resolution of software metadata using Large Language Models

Eva Martín del Pico, Josep Lluís Gelpí, Salvador Capella-Gutiérrez

机构 * Barcelona Supercomputing Center, Barcelona, Spain(巴塞罗那超级计算中心) Department of Biochemistry and Molecular Biology, University of Barcelona, Barcelona, Spain(生物化学与分子生物学系,巴塞罗那大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04013 2025-10-07 cs.CL 87%

LLM Microscope: What Model Internals Reveal About Answer Correctness and Context Utilization

Jiarui Liu, Jivitesh Jain, Mona Diab, Nishant Subramani

机构 * Carnege Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏