arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-23 至 2025-10-23 共收录 208 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 31 篇

2508.02511 2025-10-23 cs.AI cs.CL 82%

Test-time Prompt Intervention

Chenxu Yang, Qingyi Si, Mz Dai, Dingyu Yao, Mingyu Zheng, Minghui Chen, Zheng Lin, Weiping Wang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 24 pages, 20 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19055 2025-10-23 cs.AI cs.SD eess.AS 77%

The MUSE Benchmark: Probing Music Perception and Auditory Relational Reasoning in Audio LLMS

Brandon James Carone, Iran R. Roman, Pablo Ripollés

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19001 2025-10-23 cs.CV cs.AI cs.RO 77%

Robust Driving QA through Metadata-Grounded Context and Task-Specific Prompts

Seungjun Yu, Junsung Park, Youngsun Lim, Hyunjung Shim

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24625 2025-10-23 cs.CV cs.AI 77%

Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors

Duo Zheng, Shijia Huang, Yanyang Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19878 2025-10-23 cs.CL cs.IR 77%

CausalRAG: Integrating Causal Graphs into Retrieval-Augmented Generation

Nengbo Wang, Xiaotian Han, Jagdip Singh, Jing Ma, Vipin Chaudhary

机构 * Department of Computer and Data Sciences, Case Western Reserve University(计算机与数据科学系,凯斯西储大学) Department of Design and Innovation, Case Western Reserve University(设计与创新系,凯斯西储大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16880 2025-10-23 cs.CE 75%

Chem-R: Learning to Reason as a Chemist

Weida Wang, Benteng Chen, Di Zhang, Wanhao Liu, Shuchen Pu, Ben Gao, Jin Zeng, Xiaoyong Wei, Tianshu Yu, Shuzhou Sun, Tianfan Fu, Wanli Ouyang, Lei Bai, Jiatong Li, Zifu Wang, Yuqiang Li, Shufei Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)

Comments 9 pages, 5 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21776 2025-10-23 cs.CV 75%

Video-R1: Reinforcing Video Reasoning in MLLMs

Kaituo Feng, Kaixiong Gong, Bohao Li, Zonghao Guo, Yibing Wang, Tianshuo Peng, Junfei Wu, Xiaoying Zhang, Benyou Wang, Xiangyu Yue

机构 * CUHK MMLab(香港中文大学多模态实验室) CUHK (SZ)(香港中文大学(深圳)) Tsinghua University(清华大学) UCAS(中国科学院大学) CUHK HCCL(香港中文大学高性能计算实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract)

Comments NeurIPS 2025, Project page: https://github.com/tulerfeng/Video-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14489 2025-10-23 cs.AI cs.CL 73%

Reasoning Models Better Express Their Confidence

Dongkeun Yoon, Seungone Kim, Sohee Yang, Sunkyoung Kim, Soyeon Kim, Yongil Kim, Eunbi Choi, Yireun Kim, Minjoon Seo

机构 * KAIST(韩国科学技术院) LG AI Research(LG人工智能研究) CMU(卡内基梅隆大学) UCL(伦敦大学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19247 2025-10-23 cs.CL 70%

SheetBrain: A Neuro-Symbolic Agent for Accurate Reasoning over Complex and Large Spreadsheets

Ziwei Wang, Jiayuan Su, Mengyu Zhou, Huaxing Zeng, Mengni Jia, Xiao Lv, Haoyu Dong, Xiaojun Ma, Shi Han, Dongmei Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18982 2025-10-23 cs.AI 70%

Test-time Verification via Optimal Transport: Coverage, ROC, & Sub-optimality

Arpan Mukherjee, Marcello Bullo, Debabrota Basu, Deniz Gündüz

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02344 2025-10-23 cs.AI 70%

Traffic-R1: Reinforced LLMs Bring Human-Like Reasoning to Traffic Signal Control Systems

Xingchen Zou, Yuhao Yang, Zheng Chen, Xixuan Hao, Yiqi Chen, Chao Huang, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) PCITECH The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :LLM(abstract);foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19339 2025-10-23 cs.CV cs.CL 70%

PixelWorld: How Far Are We from Perceiving Everything as Pixels?

Zhiheng Lyu, Xueguang Ma, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) Vector Institute, Toronto(多伦多向量研究所)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10043 2025-10-23 cs.SE 67%

TrioXpert: An Automated Incident Management Framework for Microservice System

Yongqian Sun, Yu Luo, Xidao Wen, Yuan Yuan, Xiaohui Nie, Shenglin Zhang, Tong Liu, Xi Luo

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03158 2025-10-23 econ.GN q-fin.EC 67%

Strategizing with AI: Insights from a Beauty Contest Experiment

Iuliia Alekseenko, Dmitry Dagaev, Sofia Paklina, Petr Parshakov

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01069 2025-10-23 q-fin.GN econ.GN q-fin.EC 67%

The Promise and Peril of Generative AI: Evidence from GPT as Sell-Side Analysts

Edward Li, Min Shen, Zhiyuan Tu, Dexin Zhou

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19818 2025-10-23 cs.LG cs.AI cs.RO 62%

Semantic World Models

Jacob Berg, Chuning Zhu, Yanda Bao, Ishan Durugkar, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Sony AI(索尼人工智能)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19817 2025-10-23 cs.CV cs.CL 57%

olmOCR 2: Unit Test Rewards for Document OCR

Jake Poznanski, Luca Soldaini, Kyle Lo

机构 * Allen Institute for AI(艾伦人工智能研究所)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

Comments https://olmocr.allen.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19555 2025-10-23 cs.CV cs.CL 57%

[De|Re]constructing VLMs' Reasoning in Counting

Simone Alghisi, Gabriel Roccabruna, Massimo Rizzoli, Seyed Mahed Mousavi, Giuseppe Riccardi

机构 * University of Trento(特伦托大学) Amazon(亚马逊公司) SISLab(SIS实验室) Department of Information Engineering and Computer Science(信息工程与计算机科学系)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19171 2025-10-23 cs.CL 57%

Think Straight, Stop Smart: Structured Reasoning for Efficient Multi-Hop RAG

Jihwan Bang, Juntae Lee, Seunghan Yang, Sungha Choi

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL

Comments Accepted at NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16814 2025-10-23 cs.LG cs.CV 57%

Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning

Junhao Shen, Haiteng Zhao, Yuzhe Gu, Songyang Gao, Kuikun Liu, Haian Huang, Jianfei Gao, Dahua Lin, Wenwei Zhang, Kai Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 52 篇

2505.15695 2025-10-23 cs.CL 89%

Can Large Language Models be Effective Online Opinion Miners?

Ryang Heo, Yongsik Seo, Junseong Lee, Dongha Lee

机构 * Department of Artificial Intelligence, Yonsei University - DLI Lab(人工智能系,延世大学 - DLI实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18888 2025-10-23 cs.CL cs.AI 88%

Contextual Augmentation for Entity Linking using Large Language Models

Daniel Vollmers, Hamada M. Zahera, Diego Moussallem, Axel-Cyrille Ngonga Ngomo

机构 * Data Science Group, Paderborn University(数据科学组,帕德博恩大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19616 2025-10-23 cs.CL 88%

PBBQ: A Persian Bias Benchmark Dataset Curated with Human-AI Collaboration for Large Language Models

Farhan Farsi, Shayan Bali, Fatemeh Valeh, Parsa Ghofrani, Alireza Pakniat, Kian Kashfipour, Amir H. Payberah

机构 * Amirkabir University of Technology(阿米尔卡比尔技术大学) King’s College London(伦敦国王学院) Politecnico di Milano(米兰理工学院) KTH Royal Institute of Technology(皇家理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18582 2025-10-23 cs.CV 88%

The Photographer Eye: Teaching Multimodal Large Language Models to Understand Image Aesthetics like Photographers

Daiqing Qi, Handong Zhao, Jing Shi, Simon Jenni, Yifei Fan, Franck Dernoncourt, Scott Cohen, Sheng Li

机构 * University of Virginia(弗吉尼亚大学) Adobe(Adobe公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11000 2025-10-23 cs.SE 88%

Ever-Improving Test Suite by Leveraging Large Language Models

Ketai Qiu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Accepted by 33rd ACM International Conference on the Foundations of Software Engineering (FSE Companion '25), June 23--28, 2025, Trondheim, Norway

Journal ref Proceedings of the 33rd ACM International Conference on the Foundations of Software Engineering, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24379 2025-10-23 cs.LG cs.AI cs.CL cs.CR 87%

Unlearned but Not Forgotten: Data Extraction after Exact Unlearning in LLM

Xiaoyu Wu, Yifei Pang, Terrance Liu, Zhiwei Steven Wu

机构 * Rice University(里士大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18931 2025-10-23 cs.CY cs.AI cs.LG 86%

A Justice Lens on Fairness and Ethics Courses in Computing Education: LLM-Assisted Multi-Perspective and Thematic Evaluation

Kenya S. Andrews, Deborah Dormah Kanubala, Kehinde Aruleba, Francisco Enrique Vicente Castro, Renata A Revelo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 14 pages, 8 figures, In Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19032 2025-10-23 cs.CL cs.CY cs.HC 85%

When Can We Trust LLMs in Mental Health? Large-Scale Benchmarks for Reliable LLM Evaluation

Abeer Badawi, Elahe Rahimi, Md Tahmid Rahman Laskar, Sheri Grach, Lindsay Bertrand, Lames Danok, Jimmy Huang, Frank Rudzicz, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) Dalhousie University(达尔豪斯大学) IWK Health Hospital(IWK健康医院) King’s College London(伦敦国王学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19025 2025-10-23 cs.DB cs.AI 85%

FlexiDataGen: An Adaptive LLM Framework for Dynamic Semantic Dataset Generation in Sensitive Domains

Hamed Jelodar, Samita Bai, Roozbeh Razavi-Far, Ali A. Ghorbani

机构 * Canadian Institute for Cybersecurity(加拿大网络安全研究所) Faculty of Computer Science(计算机科学学院) University of New Brunswick(新不伦瑞克大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11791 2025-10-23 cs.LG cs.CR 85%

SEC-bench: Automated Benchmarking of LLM Agents on Real-World Software Security Tasks

Hwiwon Lee, Ziqi Zhang, Hanxiao Lu, Lingming Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏