arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-17 至 2025-10-17 共收录 228 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 42 篇

2509.17040 2025-10-17 cs.CV cs.AI 70%

From Easy to Hard: The MIR Benchmark for Progressive Interleaved Multi-Image Reasoning

Hang Du, Jiayang Zhang, Guoshun Nan, Wendi Deng, Zhenyan Chen, Chenyang Zhang, Wang Xiao, Shan Huang, Yuqi Pan, Tao Qi, Sicong Leng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01326 2025-10-17 cs.AI 70%

ORMind: A Cognitive-Inspired End-to-End Reasoning Framework for Operations Research

Zhiyuan Wang, Bokui Chen, Yinya Huang, Qingxing Cao, Ming He, Jianping Fan, Xiaodan Liang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted by Annual Meetings of the Association for Computational Linguistics 2025

Journal ref In Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track), 2025,Vienna, Austria. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13921 2025-10-17 cs.RO cs.AI 70%

APEX: Empowering LLMs with Physics-Based Task Planning for Real-time Insight

Wanjing Huang, Weixiang Yan, Zhen Zhang, Ambuj Singh

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07357 2025-10-17 cs.CL 70%

Revisiting Prompt Optimization with Large Reasoning Models-A Case Study on Event Extraction

Saurabh Srivastava, Ziyu Yao

机构 * George Mason University(乔治·马歇尔大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14672 2025-10-17 cs.CV 67%

VTimeCoT: Thinking by Drawing for Video Temporal Grounding and Reasoning

Jinglei Zhang, Yuanfan Guo, Rolandos Alexandros Potamias, Jiankang Deng, Hang Xu, Chao Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Noah’s Ark Lab(诺亚实验室) Imperial College London(伦敦帝国理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14032 2025-10-17 cs.CV 67%

Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding

Xiaoqian Shen, Wenxuan Zhang, Jun Chen, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡布斯大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

Comments NeurIPS 2025 (Spotlight). Webpage at https://xiaoqian-shen.github.io/Vgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13889 2025-10-17 cs.CV 67%

MultiFoodhat: A potential new paradigm for intelligent food quality inspection

Yue Hu, Guohang Zhuang

机构 * School of Food Science and Engineering, Central South University of Forestry and Technology(食品科学与工程学院,中南林业科技大学) School of Computer and Information, Hefei University of Technology(计算机与信息学院,合肥工业大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15693 2025-10-17 cs.CV cs.MM 67%

SCENEFORGE: Enhancing 3D-text alignment with Structured Scene Compositions

Cristian Sbrolli, Matteo Matteucci

机构 * Department of Electronics, Information and Bioengineering(电子、信息与生物工程系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

Comments to appear in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19339 2025-10-17 cs.CL cs.AI cs.LG 67%

Explanatory Summarization with Discourse-Driven Planning

Dongqi Liu, Xi Yu, Vera Demberg, Mirella Lapata

机构 * Saarland University(萨尔兰大学) University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by the Transactions of the Association for Computational Linguistics (TACL 2025)

Journal ref Dongqi Liu, Xi Yu, Vera Demberg, Mirella Lapata; Explanatory Summarization with Discourse-Driven Planning. Transactions of the Association for Computational Linguistics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14095 2025-10-17 cs.LG cs.AI 62%

Unlocking Out-of-Distribution Generalization in Transformers via Recursive Latent Space Reasoning

Awni Altabaa, Siyu Chen, John Lafferty, Zhuoran Yang

机构 * Department of Statistics & Data Science, Yale University(统计与数据科学系,耶鲁大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13800 2025-10-17 cs.CV 50%

Reasoning in Space via Grounding in the World

Yiming Chen, Zekun Qi, Wenyao Zhang, Xin Jin, Li Zhang, Peidong Liu

机构 * Westlake University(西湖大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(技术研究院) Fudan University(复旦大学)

专题命中 推理与问题求解 :LLM(abstract)

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21851 2025-10-17 cs.CV 50%

On Large Multimodal Models as Open-World Image Classifiers

Alessandro Conti, Massimiliano Mancini, Enrico Fini, Yiming Wang, Paolo Rota, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 推理与问题求解 :prompting(abstract)

Comments Accepted at ICCV2025, 23 pages, 13 figures, code is available at https://github.com/altndrr/lmms-owc

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18623 2025-10-17 cs.CV 50%

Training-Free Personalization via Retrieval and Reasoning on Fingerprints

Deepayan Das, Davide Talon, Yiming Wang, Massimiliano Mancini, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯瑟实验室)

专题命中 推理与问题求解 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 53 篇

2504.07887 2025-10-17 cs.CL cs.AI 92%

Benchmarking Adversarial Robustness to Bias Elicitation in Large Language Models: Scalable Automated Assessment with LLM-as-a-Judge

Riccardo Cantini, Alessio Orsino, Massimo Ruggiero, Domenico Talia

机构 * University of Calabria(卡利博利亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Journal ref Cantini, R., Orsino, A., Ruggiero, M., Talia, D. Benchmarking adversarial robustness to bias elicitation in large language models: scalable automated assessment with LLM-as-a-judge. Mach Learn 114, 249 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12045 2025-10-17 cs.CY cs.AI 89%

Large Language Models Enable Design of Personalized Nudges across Cultures

Vladimir Maksimenko, Qingyao Xin, Prateek Gupta, Bin Zhang, Prateek Bansal

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14471 2025-10-17 cs.CL 89%

Why We Build Local Large Language Models: An Observational Analysis from 35 Japanese and Multilingual LLMs

Koshiro Saito, Sakae Mizuki, Masanari Ohi, Taishi Nakamura, Taihei Shiotani, Koki Maeda, Youmi Ma, Kakeru Hattori, Kazuki Fujii, Takumi Okamoto, Shigeki Ishida, Hiroya Takamura, Rio Yokota, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) NII LLMC(日本信息基础设施中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted as a spotlight at the 1st workshop on Multilingual and Equitable Language Technologies (MELT), COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13812 2025-10-17 cs.HC 89%

MindBenchAI: An Actionable Platform to Evaluate the Profile and Performance of Large Language Models in a Mental Healthcare Context

Bridget Dwyer, Matthew Flathers, Akane Sano, Allison Dempsey, Andrea Cipriani, Asim H. Gazi, Carla Gorban, Carolyn I. Rodriguez, Charles Stromeyer, Darlene King, Eden Rozenblit, Gillian Strudwick, Jake Linardon, Jiaee Cheong, Joseph Firth, Julian Herpertz, Julian Schwarz, Margaret Emerson, Martin P. Paulus, Michelle Patriquin, Yining Hua, Soumya Choudhary, Steven Siddals, Laura Ospina Pinillos, Jason Bantjes, Steven Scheuller, Xuhai Xu, Ken Duckworth, Daniel H. Gillison, Michael Wood, John Torous

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14866 2025-10-17 cs.CV cs.AI cs.CL 88%

Benchmarking Multimodal Large Language Models for Face Recognition

Hatef Otroshi Shahreza, Sébastien Marcel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12171 2025-10-17 cs.CL cs.AI 88%

Preservation of Language Understanding Capabilities in Speech-aware Large Language Models

Marek Kubis, Paweł Skórzewski, Iwona Christop, Mateusz Czyżnikiewicz, Jakub Kubiak, Łukasz Bondaruk, Marcin Lewandowski

机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 5 pages, 1 figure; benchmark code available at https://github.com/SamsungLabs/C3T

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07188 2025-10-17 cs.CL cs.AI cs.CY 88%

Prompt Perturbations Reveal Human-Like Biases in Large Language Model Survey Responses

Jens Rupprecht, Georg Ahnert, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS – Leibniz Institute for the Social Sciences(社会科学研究莱比锡研究所) Complexity Science Hub(复杂科学中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14318 2025-10-17 cs.CL cs.AI cs.LG 88%

Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL

Marwa Abdulhai, Ryan Cheng, Aryansh Shrivastava, Natasha Jaques, Yarin Gal, Sergey Levine

机构 * UC Berkeley(伯克利大学) University of Oxford(牛津大学) University of Washington(华盛顿大学) UK AI Security Institute(英国人工智能安全研究所) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14845 2025-10-17 cs.CL 87%

AAVENUE: Detecting LLM Biases on NLU Tasks in AAVE via a Novel Benchmark

Abhay Gupta, Philip Meng, Ece Yurtseven, Sean O'Brien, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI 研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Published at NLP4PI @ EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13430 2025-10-17 cs.CL 86%

Evaluating Arabic Large Language Models: A Survey of Benchmarks, Methods, and Gaps

Ahmed Alzubaidi, Shaikha Alsuwaidi, Basma El Amel Boussaha, Leen AlQadi, Omar Alkaabi, Mohammed Alyafeai, Hamza Alobeidli, Hakim Hacid

机构 * Technology Innovation Institute(技术创新研究所)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14966 2025-10-17 cs.LG stat.ML 85%

Identity-Link IRT for Label-Free LLM Evaluation: Preserving Additivity in TVD-MI Scores

Zachary Robertson

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14756 2025-10-17 cs.CL 85%

Pluto: A Benchmark for Evaluating Efficiency of LLM-generated Hardware Code

Manar Abdelatty, Maryam Nouh, Jacob K. Rosenstein, Sherief Reda

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13091 2025-10-17 cs.HC 85%

Unmasking Hiring Bias: Platform Data Analysis and Controlled Experiments on Bias in Online Freelance Marketplaces via RAG-LLM Generated Contents

Wugeng Zheng, Guohou Shan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14700 2025-10-17 cs.SE cs.CR 85%

LLM Agents for Automated Web Vulnerability Reproduction: Are We There Yet?

Bin Liu, Yanjie Zhao, Guoai Xu, Haoyu Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08670 2025-10-17 cs.SE 85%

Augmenting Smart Contract Decompiler Output through Fine-grained Dependency Analysis and LLM-facilitated Semantic Recovery

Zeqin Liao, Yuhong Nan, Zixu Gao, Henglong Liang, Sicheng Hao, Peifan Reng, Zibin Zheng

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments This is the author version of the article accepted for publication in IEEE Transactions on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13721 2025-10-17 cs.CL cs.AI cs.CV cs.MM 81%

NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching

Run Luo, Xiaobo Xia, Lu Wang, Longze Chen, Renke Shan, Jing Luo, Min Yang, Tat-Seng Chua

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) NExT++ Research Center(NExT++研究中心) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14271 2025-10-17 cs.CL cs.AI cs.LG 80%

Less is More: Denoising Knowledge Graphs For Retrieval Augmented Generation

Yilun Zheng, Dan Yang, Jie Li, Lin Shang, Lihui Chen, Jiahao Xu, Sitao Luan

机构 * Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) Mila, Quebec AI Institute(魁北克AI研究所) University of Montreal(蒙特利尔大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏