arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-02 至 2025-10-02 共收录 192 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 35 篇

2510.00449 2025-10-02 cs.CL 77%

Enhancing Rating Prediction with Off-the-Shelf LLMs Using In-Context User Reviews

Koki Ryu, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) Riken(理化学研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 PALS Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26093 2025-10-02 cs.CL 77%

Reinforced Strategy Optimization for Conversational Recommender Systems via Network-of-Experts

Xiaoyan Zhao, Ming Yan, Yang Zhang, Yang Deng, Jian Wang, Fengbin Zhu, Yilun Qiu, Hong Cheng, Tat-Seng Chua

机构 * The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23619 2025-10-02 cs.AI 77%

Reasoning Scaffolding: Distilling the Flow of Thought from LLMs

Xiangyu Wen, Junhua Huang, Zeju Li, Min Li, Jianyuan Zhong, Zhijian Xu, Mingxuan Yuan, Yongxiang Huang, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) HUAWEI Noah’s Ark Lab(华为诺亚实验室) Southeast University(东南大学) HUAWEI Hong Kong Research Center(华为香港研究中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18706 2025-10-02 cs.LG cs.AI 76%

Steering LLM Reasoning Through Bias-Only Adaptation

Viacheslav Sinii, Alexey Gorbatovski, Artem Cherepanov, Boris Shaposhnikov, Nikita Balagansky, Daniil Gavrilov

机构 * T-Tech Central University(中央大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.AI、cs.LG

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14999 2025-10-02 cs.LG cs.AI cs.CL stat.ML 75%

Learning to Rank Chain-of-Thought: Using a Small Model

Eric Hanchen Jiang, Haozheng Luo, Shengyuan Pang, Xiaomin Li, Zhenting Qi, Hengli Li, Cheng-Fu Yang, Zongyu Lin, Xinfeng Li, Hao Xu, Kai-Wei Chang, Ying Nian Wu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01180 2025-10-02 cs.LG cs.CL 73%

BroRL: Scaling Reinforcement Learning via Broadened Exploration

Jian Hu, Mingjie Liu, Ximing Lu, Fang Wu, Zaid Harchaoui, Shizhe Diao, Yejin Choi, Pavlo Molchanov, Jun Yang, Jan Kautz, Yi Dong

机构 * NVIDIA Stanford University(斯坦福大学) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22929 2025-10-02 cs.CL cs.AI cs.CV cs.MA 73%

EH-Benchmark Ophthalmic Hallucination Benchmark and Agent-Driven Top-Down Traceable Reasoning Workflow

Xiaoyu Pan, Yang Bai, Ke Zou, Yang Zhou, Jun Zhou, Huazhu Fu, Yih-Chung Tham, Yong Liu

机构 * Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科技研究局(A*STAR)) Centre for Innovation and Precision Eye Health(创新与精准眼健康中心) Department of Ophthalmology, NUHS Tower Block, Level 7, 1E Kent Ridge Road, Singapore, 119228(眼科部,NUHS塔楼7层,1E Kent Ridge Road,新加坡,119228) Singapore Eye Research Institute, Singapore National Eye Centre, 20 College Road, Singapore, 169856(新加坡眼研究 institute,新加坡国家眼科中心,20 College Road,新加坡,169856)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 9 figures, 5 tables. submit/6621751

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17017 2025-10-02 cs.AI cs.FL cs.LG cs.LO 73%

Neural Theorem Proving: Generating and Structuring Proofs for Formal Verification

Balaji Rao, William Eiers, Carlo Lipizzi

专题命中 推理与问题求解 :LLM(abstract);SFT(abstract);分类 cs.AI、cs.LG

Comments Accepted to the Proceedings of the 19th Conference on Neurosymbolic Learning and Reasoning (NeSy 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00732 2025-10-02 cs.AI 70%

EvolProver: Advancing Automated Theorem Proving by Evolving Formalized Problems via Symmetry and Difficulty

Yuchen Tian, Ruiyuan Huang, Xuanwu Wang, Jing Ma, Zengfeng Huang, Ziyang Luo, Hongzhan Lin, Da Zheng, Lun Du

机构 * Hong Kong Baptist University(香港 Baptist 大学) Ant Group(蚂蚁集团) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00855 2025-10-02 cs.CV cs.AI cs.CL cs.LG 67%

Can World Models Benefit VLMs for World Dynamics?

Kevin Zhang, Kuangzhi Ge, Xiaowei Chi, Renrui Zhang, Shaojun Shi, Zhen Dong, Sirui Han, Shanghang Zhang

机构 * Peking University(北京大学) Hong Kong University of Science and Technology(香港科学与技术大学) Chinese University of Hong Kong(香港中文大学) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project page: https://dyva-worldlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18810 2025-10-02 cs.AI cs.CL cs.CV 62%

ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation

Siao Tang, Xinyin Ma, Gongfan Fang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI

Comments Compare with more baselines, add more in-depth analysis, and re-evaluate the GPQA-D benchmark. Codes are available at https://github.com/tsa18/ConciseHint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00300 2025-10-02 cs.AI 57%

ICL Optimized Fragility

Serena Gomez Wannaz

机构 * Serena Gomez Wannaz(独立研究者)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00161 2025-10-02 cs.CL 57%

TAMA: Tool-Augmented Multimodal Agent for Procedural Activity Understanding

Kimihiro Hasegawa, Wiradee Imrattanatrai, Masaki Asada, Ken Fukuda, Teruko Mitamura

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

Comments 21 pages. Code: https://github.com/kimihiroh/tama

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01010 2025-10-02 cs.CV 50%

ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning

Yuxiang Guo, Jiang Liu, Ze Wang, Hao Chen, Ximeng Sun, Yang Zhao, Jialian Wu, Xiaodong Yu, Zicheng Liu, Emad Barsoum

机构 * Johns Hopkins University(约翰霍普金斯大学) AMD(AMD公司)

专题命中 推理与问题求解 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02723 2025-10-02 cs.RO 50%

ImpedanceGPT: VLM-driven Impedance Control of Swarm of Mini-drones for Intelligent Navigation in Dynamic Environment

Faryal Batool, Yasheerah Yaqoot, Malaika Zafar, Roohan Ahmed Khan, Muhammad Haris Khan, Aleksey Fedoseev, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科沃科学与技术研究所)

专题命中 推理与问题求解 :language model(abstract)

Comments Accepted in IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 45 篇

2508.17621 2025-10-02 cs.CL cs.AI 88%

Steering When Necessary: Flexible Steering Large Language Models with Backtracking

Zifeng Cheng, Jinwei Gan, Zhiwei Jiang, Cong Wang, Yafeng Yin, Xiang Luo, Yuchen Fu, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05453 2025-10-02 cs.CL cs.AI cs.CV 88%

MLLM-CL: Continual Learning for Multimodal Large Language Models

Hongbo Zhao, Fei Zhu, Haiyang Guo, Meng Wang, Rundong Wang, Gaofeng Meng, Zhaoxiang Zhang

机构 * UCAS(中国科学院自动化研究所) CASIA(中国科学院自动化研究所) HKISI, CAS(中国科学院香港研究所) HKU(香港大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00567 2025-10-02 cs.CL 88%

Are Large Language Models Chronically Online Surfers? A Dataset for Chinese Internet Meme Explanation

Yubo Xie, Chenkai Wang, Zongyang Ma, Fahui Miao

机构 * Shanghai Maritime University(上海 Maritime 大学) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Xi’an Jiaotong Liverpool University(西安交通大学利物浦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Main Conference. 22 pages, 3 figures, 13 tables. GitHub: github.com/yuboxie/chime

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01164 2025-10-02 cs.CL cs.AI cs.CY cs.HC 86%

Social Welfare Function Leaderboard: When LLM Agents Allocate Social Welfare

Zhengliang Shi, Ruotian Ma, Jen-tse Huang, Xinbei Ma, Xingyu Chen, Mengru Wang, Qu Yang, Yue Wang, Fanghua Ye, Ziyang Chen, Shanyi Wang, Cixing Li, Wenxuan Wang, Zhaopeng Tu, Xiaolong Li, Zhaochun Ren, Linus

机构 * Tencent(腾讯)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20097 2025-10-02 cs.CL cs.AI 86%

Integrated Framework for LLM Evaluation with Answer Generation

Sujeong Lee, Hayoung Lee, Seongsoo Heo, Wonik Choi

机构 * Inha University(成均馆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 16pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07132 2025-10-02 cs.LG cs.CL 86%

LLM-based feature generation from text for interpretable machine learning

Vojtěch Balek, Lukáš Sýkora, Vilém Sklenák, Tomáš Kliegr

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Journal ref Machine Learning (2025) 114:241

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00844 2025-10-02 cs.AI 85%

Learning Compact Representations of LLM Abilities via Item Response Theory

Jianhao Chen, Chenxu Wang, Gengrui Zhang, Peng Ye, Lei Bai, Wei Hu, Yuzhong Qu, Shuyue Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Department of Psychology, University of Southern California(美国南加州大学心理学系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00797 2025-10-02 cs.CV cs.AI 85%

Solar PV Installation Potential Assessment on Building Facades Based on Vision and Language Foundation Models

Ruyu Liu, Dongxu Zhuang, Jianhua Zhang, Arega Getaneh Abate, Per Sieverts Nielsen, Ben Wang, Xiufeng Liu

机构 * Technical University of Denmark(技术大学)

专题命中 评测与基准 :foundation model(title);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00324 2025-10-02 cs.SE cs.IR cs.LG 85%

Which Programming Language and Model Work Best With LLM-as-a-Judge For Code Retrieval?

Lucas Roberts, Denisa Roberts

机构 * Independent Researcher(独立研究者) New York University(纽约大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted as a full paper at SIGIR-AP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19136 2025-10-02 cs.SE cs.AI 85%

On the Soundness and Consistency of LLM Agents for Executing Test Cases Written in Natural Language

Sébastien Salva, Redha Taguelmimt

机构 * LIMOS - UMR CNRS 6158, Clermont Auvergne University, UCA, Aubière, France(克莱蒙特奥弗涅大学) Department of Computing, Main University, MySecondTown, MyCountry(计算机系,主大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18980 2025-10-02 cs.AI cs.HC cs.IR 85%

From latent factors to language: a user study on LLM-generated explanations for an inherently interpretable matrix-based recommender system

Maxime Manderlier, Fabian Lecron, Olivier Vu Thanh, Nicolas Gillis

机构 * Department of Technological Innovation Management, Faculty of Engineering, University of Mons (UMONS), Mons, Belgium(蒙斯大学工程学院技术创新管理系) Department of Mathematics and Operational Research, Faculty of Engineering, University of Mons (UMONS), Mons, Belgium(蒙斯大学工程学院数学与运筹学系) Department of Mathematics(数学系) Operational Research, Faculty of Engineering, University of Mons (UMONS), Mons, Belgium(运筹学系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Journal ref In Proceedings of the 12th Joint Workshop on Interfaces and Human Decision Making for Recommender Systems (IntRS 2025) co-located with 19th ACM Conference on Recommender Systems (RecSys 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25413 2025-10-02 cs.CV 82%

DepthLM: Metric Depth From Vision Language Models

Zhipeng Cai, Ching-Feng Yeh, Hu Xu, Zhuang Liu, Gregory Meyer, Xinjie Lei, Changsheng Zhao, Shang-Wen Li, Vikas Chandra, Yangyang Shi

机构 * Meta Princeton University(普林斯顿大学)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03748 2025-10-02 cs.LG cs.AI cs.CL 82%

TDBench: A Benchmark for Top-Down Image Understanding with Reliability Analysis of Vision-Language Models

Kaiyuan Hou, Minghui Zhao, Lilin Xu, Yuang Fan, Xiaofan Jiang

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01052 2025-10-02 cs.CL cs.AI 81%

Hybrid Dialogue State Tracking for Persian Chatbots: A Language Model-Based Approach

Samin Mahdipour Aghabagher, Saeedeh Momtazi

机构 * Computer Engineering Department, Amirkabir University of Technology(阿米尔卡比尔技术大学计算机工程系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

Comments 22 pages, 1 figure. Submitted to Natural Language Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01179 2025-10-02 cs.LG cs.AI cs.CL 80%

TOUCAN: Synthesizing 1.5M Tool-Agentic Data from Real-World MCP Environments

Zhangchen Xu, Adriana Meza Soria, Shawn Tan, Anurag Roy, Ashish Sunil Agrawal, Radha Poovendran, Rameswar Panda

机构 * University of Washington(华盛顿大学) MIT-IBM Watson AI Lab(MIT-IBM Watson人工智能实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 35 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏