arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-13 至 2025-11-13 共收录 183 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 29 篇

2511.09127 2025-11-13 cs.AI cs.CL cs.CV cs.HC 73%

History-Aware Reasoning for GUI Agents

Ziwei Wang, Leyang Yang, Xiaoxuan Tang, Sheng Zhou, Dajun Chen, Wei Jiang, Yong Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Paper accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16874 2025-11-13 cs.CL cs.AI 73%

MARS: Multi-Agent Adaptive Reasoning with Socratic Guidance for Automated Prompt Optimization

Jian Zhang, Zhangqi Wang, Haiping Zhu, Kangda Cheng, Kai He, Bo Li, Qika Lin, Jun Liu, Erik Cambria

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08942 2025-11-13 cs.RO cs.AI 70%

Think, Remember, Navigate: Zero-Shot Object-Goal Navigation with VLM-Powered Reasoning

Mobin Habibpour, Fatemeh Afghah

机构 * Holcombe Department of Electrical and Computer Engineering(霍尔科姆电气与计算机工程系) Clemson University(克莱姆森大学)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10391 2025-11-13 cs.AI 70%

LeanRAG: Knowledge-Graph-Based Generation with Semantic Aggregation and Hierarchical Retrieval

Yaoze Zhang, Rong Wu, Pinlong Cai, Xiaoman Wang, Guohang Yan, Song Mao, Ding Wang, Botian Shi

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted by AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16905 2025-11-13 cs.AI 70%

MAPS: Multi-Agent Personality Shaping for Collaborative Reasoning

Jian Zhang, Zhiyuan Wang, Zhangqi Wang, Fangzhi Xu, Qika Lin, Lingling Zhang, Rui Mao, Erik Cambria, Jun Liu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08782 2025-11-13 cs.CL 70%

EmoDynamiX: Emotional Support Dialogue Strategy Prediction by Modelling MiXed Emotions and Discourse Dynamics

Chenwei Wan, Matthieu Labeau, Chloé Clavel

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,Telecom Paris, Institut Polytechnique de Paris) Inria Paris(Inria巴黎)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to NAACL 2025 main, long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08649 2025-11-13 q-bio.QM cs.AI 70%

Bio AI Agent: A Multi-Agent Artificial Intelligence System for Autonomous CAR-T Cell Therapy Development with Integrated Target Discovery, Toxicity Prediction, and Rational Molecular Design

Yi Ni, Liwei Zhu, Shuai Li

机构 * Bio LIMS INC(Bio LIMS公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 12 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08600 2025-11-13 cs.CL cs.HC 70%

Retrieval-Augmented Generation of Pediatric Speech-Language Pathology vignettes: A Proof-of-Concept Study

Yilan Liu

机构 * University of Redlands, Department of Communication Sciences and Disorders, Truesdail Clinic Center(红lands大学,沟通科学与障碍系,Truesdail诊所中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 37 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08971 2025-11-13 cs.HC cs.CV cs.MM 67%

Plug-and-Play Clarifier: A Zero-Shot Multimodal Framework for Egocentric Intent Disambiguation

Sicheng Yang, Yukai Huang, Weitong Cai, Shitong Sun, You He, Jiankang Deng, Hang Zhang, Jifei Song, Zhensong Zhang

专题命中 推理与问题求解 :language model(abstract);small language model(abstract)

Comments 16 pages, 9 figures, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02458 2025-11-13 cs.DB 67%

From Stimuli to Minds: Enhancing Psychological Reasoning in LLMs via Bilateral Reinforcement Learning

Yichao Feng, Haoran Luo, Lang Feng, Shuai Zhao, Anh Tuan Luu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17582 2025-11-13 cs.HC cs.GR cs.MM 67%

Crafting Dynamic Virtual Activities with Advanced Multimodal Models

Changyang Li, Qingan Yan, Minyoung Kim, Zhan Li, Yi Xu, Lap-Fai Yu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

Journal ref C. Li, Q. Yan, M. Kim, Z. Li, Y. Xu and L. -F. Yu, "Crafting Dynamic Virtual Activities with Advanced Multimodal Models," 2025 IEEE International Symposium on Mixed and Augmented Reality (ISMAR), pp. 120-130

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08609 2025-11-13 cs.CV cs.AI cs.LG 62%

Case Study: Transformer-Based Solution for the Automatic Digitization of Gas Plants

I. Bailo, F. Buonora, G. Ciarfaglia, L. T. Consoli, A. Evangelista, M. Gabusi, M. Ghiani, C. Petracca Ciavarella, F. Picariello, F. Sarcina, F. Tuosto, V. Zullo, L. Airoldi, G. Bruno, D. D. Gobbo, S. Pezzenati, G. A. Tona

机构 * Engineering Group(工程集团) Snam S.p.A.(Snam公司)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08715 2025-11-13 cs.AI 57%

Bridging Natural Language and ASP: A Hybrid Approach Using LLMs and AMR Parsing

Connar Hite, Sean Saud, Raef Taha, Nayim Rahman, Tanvir Atahary, Scott Douglass, Tarek Taha

机构 * United States Air Force(美国空军)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08608 2025-11-13 q-fin.ST 50%

When Reasoning Fails: Evaluating 'Thinking' LLMs for Stock Prediction

Rakeshkumar H Sodha

专题命中 推理与问题求解 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 48 篇

2505.16774 2025-11-13 cs.CL 89%

IFEval-Audio: Benchmarking Instruction-Following Capability in Audio-based Large Language Models

Yiming Gao, Bin Wang, Chengwei Wei, Shuo Sun, AiTi Aw

机构 * Nanyang Technological University (NTU)(南洋理工大学) MiroMind(米罗Mind) Institute for Infocomm Research (I 2 R)(信息与通信研究院) A*STAR(科技研究局)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Link: https://github.com/AudioLLMs/AudioBench/tree/main/IFEval-Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23175 2025-11-13 cs.CR cs.AI cs.LG 88%

Large Language Models Are Unreliable for Cyber Threat Intelligence

Emanuele Mezzi, Fabio Massacci, Katja Tuma

机构 * Springer Nature Switzerland(斯普林格·自然瑞士)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08598 2025-11-13 cs.CL cs.AI 88%

OKBench: Democratizing LLM Evaluation with Fully Automated, On-Demand, Open Knowledge Benchmarking

Yanhong Li, Tianyang Xu, Kenan Tang, Karen Livescu, David McAllester, Jiawei Zhou

机构 * University of Chicago(芝加哥大学) TTI-Chicago(芝加哥技术研究所) UC Santa Barbara(圣巴巴拉大学) Stony Brook University(石溪大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15153 2025-11-13 cs.CL 86%

Evaluating Deep Unlearning in Large Language Models

Ruihan Wu, Chhavi Yadav, Russ Salakhutdinov, Kamalika Chaudhuri

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09374 2025-11-13 cs.CL cs.AI 84%

MTQ-Eval: Multilingual Text Quality Evaluation for Language Models

Rhitabrat Pokharel, Ameeta Agrawal

机构 * Department of Computer Science(计算机科学系) Portland State University(波特兰州立大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09363 2025-11-13 cs.AI cs.GT cs.LG 84%

ElicitationGPT: Text Elicitation Mechanisms via Language Models

Yifan Wu, Jason Hartline

机构 * Microsoft Research(微软研究院) Northwestern University(西北大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09003 2025-11-13 cs.CL 83%

Detecting Emotional Dynamic Trajectories: An Evaluation Framework for Emotional Support in Language Models

Zhouxing Tan, Ruochong Xiong, Yulong Wan, Jinlong Ma, Hanlin Xue, Qichun Deng, Haifeng Jing, Zhengtong Zhang, Depei Liu, Shiyuan Luo, Junfei Liu

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24792 2025-11-13 cs.CV cs.AI 83%

PISA-Bench: The PISA Index as a Multilingual and Multimodal Metric for the Evaluation of Vision-Language Models

Patrick Haller, Fabio Barth, Jonas Golde, Georg Rehm, Alan Akbik

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

Comments 8 pages, 11 tables and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09488 2025-11-13 cs.LG 81%

AutoSynth: Automated Workflow Optimization for High-Quality Synthetic Dataset Generation via Monte Carlo Tree Search

Shuzhen Bi, Chang Song, Siyu Song, Jinze Lv, Jian Chen, Xinyun Wang, Aimin Zhou, Hao Hao

机构 * Shanghai Innavation Institute(上海创新研究院) Shanghai Institute of AI for Education(上海人工智能教育研究院) Department of Education Information Technology(教育信息技术部) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09339 2025-11-13 cs.CL 79%

mmJEE-Eval: A Bilingual Multimodal Benchmark for Evaluating Scientific Reasoning in Vision-Language Models

Arka Mukherjee, Shreya Ghosh

机构 * Kalinga Institute of Industrial Technology (KIIT)(喀里亚理工学院) Indian Institute of Technology (IIT), Bhubaneswar(印度理工学院(班加罗尔))

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments Accepted to IJCNLP-AACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22159 2025-11-13 cs.CL cs.AI 79%

IndoPref: A Multi-Domain Pairwise Preference Dataset for Indonesian

Vanessa Rebecca Wiyono, David Anugraha, Ayu Purwarianti, Genta Indra Winata

机构 * Institut Teknologi Bandung(技术科技大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04062 2025-11-13 eess.IV cs.CV 78%

PET2Rep: Towards Vision-Language Model-Drived Automated Radiology Report Generation for Positron Emission Tomography

Yichi Zhang, Wenbo Zhang, Zehui Ling, Gang Feng, Sisi Peng, Deshu Chen, Yuchen Liu, Hongwei Zhang, Shuqi Wang, Lanlan Li, Limei Han, Yuan Cheng, Zixin Hu, Yuan Qi, Le Xue

专题命中 评测与基准 :language model(title,abstract)

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18145 2025-11-13 cs.CV 78%

CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language Models

Xiao An, Jiaxing Sun, Zihan Gui, Wei He

机构 * State Key Lab. LIESMARS, Wuhan University(武汉大学遥感信息与地学实验室国家重点实验室)

专题命中 评测与基准 :language model(title,abstract)

Comments Accepted by NeurIPS 2025 Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16222 2025-11-13 eess.IV cs.CV 78%

UltraSam: A Foundation Model for Ultrasound using Large Open-Access Segmentation Datasets

Adrien Meyer, Aditya Murali, Farahdiba Zarin, Didier Mutter, Nicolas Padoy

机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, Strasbourg, France(斯特拉斯堡大学,法国国家科学研究中心,法国国家卫生研究院,ICube,UMR7357,斯特拉斯堡,法国) IHU-Strasbourg, Institute of Image-Guided Surgery, Strasbourg, France(斯特拉斯堡IHU,影像引导手术研究所,斯特拉斯堡,法国)

专题命中 评测与基准 :foundation model(title,abstract)

Comments 7 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09310 2025-11-13 cs.CL cs.HC 77%

LiteraryTaste: A Preference Dataset for Creative Writing Personalization

John Joon Young Chung, Vishakh Padmakumar, Melissa Roemmele, Yi Wang, Yuqian Sun, Tiffany Wang, Shm Garanganao Almeda, Brett A. Halperin, Yuwen Lu, Max Kreminski

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Notre Dame(圣母大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09200 2025-11-13 cs.LG 77%

Sure! Here's a short and concise title for your paper: "Contamination in Generated Text Detection Benchmarks"

Philipp Dingfelder, Christian Riess

机构 * IT Security Infrastructures Lab, FAU Erlangen-Nürnberg(FAU埃尔兰根-纽伦堡大学信息安全部署实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments published at CSCML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏