arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-16 至 2025-12-16 共收录 36 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 36 篇

2502.20601 2025-12-16 cs.AI cs.CL cs.LG 90%

NutriGen: Personalized Meal Plan Generator Leveraging Large Language Models to Enhance Dietary and Nutritional Adherence

NutriGen:利用大型语言模型生成个性化餐计划以提高饮食和营养依从性

Saman Khamesian, Asiful Arefeen, Stephanie M. Carpenter, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NutriGen利用大型语言模型生成个性化餐计划,通过构建营养数据库和提示工程提高饮食依从性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11656 2025-12-16 cs.MA cs.AI cs.CL 88%

MALLM: Multi-Agent Large Language Models Framework

MALLM:多智能体大语言模型框架

Jonas Becker, Lars Benedikt Kaesberg, Niklas Bauer, Jan Philip Wahle, Terry Ruas, Bela Gipp

机构 * University of Göttingen(哥廷根大学) LKA NRW(北莱茵-威斯特法伦州实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 MALLM是一个开源框架,通过提供多种配置选项,系统分析多智能体辩论的组件,促进对智能体角色、响应生成器、讨论范式和决策协议的深入理解。

Comments Accepted at EMNLP 2025 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13063 2025-12-16 cs.CL cs.AI 87%

LLM Rationalis? Measuring Bargaining Capabilities of AI Negotiators

LLM Rationalis? 测量AI谈判者的协商能力

Cheril Shah, Akshit Agarwal, Kanak Garg, Mourad Heddaya

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

AI总结 本文研究了AI谈判者的协商能力,发现LLMs在谈判中系统性地锚定在极端位置,缺乏策略多样性,且协商能力不随模型改进而提升。

Comments Published in the First Workshop on Multi-Turn Interactions in Large Language Models at Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11907 2025-12-16 cs.AI 86%

Structured Personalization: Modeling Constraints as Matroids for Data-Minimal LLM Agents

结构化个性化:将约束建模为Matroid以实现数据最小的LLM代理

Daniel Platnick, Marjan Alirezaie, Hossein Rahnama

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过Matroid建模约束,实现数据最小的LLM个性化方法,解决现实中的结构化约束问题。

Comments Accepted to the AAAI 2026 Workshop on Personalization in the Era of Large Foundation Models (PerFM), 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03846 2025-12-16 cs.CL 85%

Do LLM Evaluators Prefer Themselves for a Reason?

大语言模型评估器为何偏好自己?

Wei-Lin Chen, Zhepei Wei, Xinyu Zhu, Shi Feng, Yu Meng

机构 * University of Virginia(弗吉尼亚大学) George Washington University(乔治华盛顿大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了大语言模型在评估时自我偏好现象的成因,发现更强模型更倾向于偏好自身输出,但其中大部分偏好源于客观质量优势,同时提出通过扩展策略可减少有害自我偏好。

Comments Added LMArena experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12224 2025-12-16 cs.SE cs.CR 85%

Cluster-guided LLM-Based Anonymization of Software Analytics Data: Studying Privacy-Utility Trade-offs in JIT Defect Prediction

基于聚类的LLM软件分析数据匿名化:研究JIT缺陷预测中的隐私-效用权衡

Maaz Khan, Gul Sher Khan, Ahsan Raza, Pir Sami Ullah, Abdul Ali Bangash

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于LLM的聚类引导去标识化方法,用于JIT缺陷预测中的隐私-效用权衡研究,通过上下文感知参数配置提升隐私保护水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12487 2025-12-16 cs.CV 82%

More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models

不止于最终答案:提升视觉提取和逻辑一致性的视觉语言模型

Hoang Anh Just, Yifei Fan, Handong Zhao, Jiuxiang Gu, Ruiyi Zhang, Simon Jenni, Kushal Kafle, Ruoxi Jia, Jing Shi

机构 * Virginia Tech(弗吉尼亚理工大学) Adobe Research(Adobe研究院) Apple(苹果公司)

专题命中 推理与问题求解 :language model(title,abstract);SFT(abstract)

AI总结 PeRL-VL通过解耦框架提升视觉语言模型的视觉提取和推理一致性,实现Pass@1准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12042 2025-12-16 cs.CL 81%

Benchmarking Contextual Understanding for In-Car Conversational Systems

车载对话系统上下文理解评估

Philipp Habicht, Lev Sorokin, Abdullah Saydemir, Ken E. Friedl, Andrea Stocco

机构 * Humboldt University of Berlin(柏林洪堡大学) Technical University of Munich(慕尼黑技术大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过LLM和提示技术评估车载对话系统上下文理解,发现非推理模型在成本效率上表现最佳,DeepSeek-R1达到高F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13159 2025-12-16 cs.AI cs.CL 81%

SpeakRL: Synergizing Reasoning, Speaking, and Acting in Language Models with Reinforcement Learning

SpeakRL: 在语言模型中协同推理、说话与行动以增强强化学习

Emre Can Acikgoz, Jinoh Oh, Jie Hao, Joo Hyuk Jeon, Heng Ji, Dilek Hakkani-Tür, Gokhan Tur, Xiang Li, Chengyuan Ma, Xing Fan

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Alexa(亚马逊Alexa)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 SpeakRL通过强化学习提升语言模型的对话能力,通过奖励主动互动提高任务完成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09535 2025-12-16 cs.LG 80%

Latent-Autoregressive GP-VAE Language Model

潜在自回归GP-VAE语言模型

Yves Ruffenach

机构 * Conservatoire National des Arts et Métiers(法国国家艺术与工艺 conservatoire)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

AI总结 该研究提出了一种基于高斯过程和变分自编码器的潜在自回归模型,通过概率几何支持语言模型的时间结构,而非显式神经运算。

Comments 27 pages, 1 figure, 4 tables. Proof-of-concept study of a latent-autoregressive GP-VAE language model with TCN encoder and non-autoregressive decoder. Code available at https://github.com/y-v-e-s/GP-VAE-Latent-AR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12794 2025-12-16 eess.SY cs.SY 80%

A Rule-Aware Prompt Framework for Structured Numeric Reasoning in Cyber-Physical Systems

面向物理系统结构化数值推理的规则感知提示框架

Yichen Liu, Hongyu Wu, Bo Liu

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种规则感知提示框架,用于在基于物理的系统中实现结构化数值推理,通过模块化设计提升规则遵循性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12596 2025-12-16 cs.CV cs.AI 79%

Content-Aware Ad Banner Layout Generation with Two-Stage Chain-of-Thought in Vision Language Models

基于视觉语言模型的双阶段链式思考内容感知广告布局生成

Kei Yoshitake, Kento Hosono, Ken Kobayashi, Kazuhide Nakata

机构 * Institute of Science Tokyo(东京科学研究所) HAKUHODO Technologies Inc.(HAKUHODO技术公司)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出基于视觉语言模型的双阶段链式思考方法,用于生成高质量的广告布局,通过分析背景图像内容来提升布局质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17904 2025-12-16 cs.CR cs.AI cs.CL 79%

BreakFun: Jailbreaking LLMs via Schema Exploitation

BreakFun: 通过模式利用对LLM进行劫持

Amirkia Rafiei Oskooei, Mehmet S. Aktas

机构 * Department of Computer Engineering, Yildiz Technical University(计算机工程系,伊兹密尔技术大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 BreakFun通过利用LLM对结构模式的遵守能力,揭示了其在劫持攻击中的脆弱性,并提出对抗性提示解构作为缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10019 2025-12-16 cs.CL cs.AI 79%

Decoupling Understanding from Reasoning via Problem Space Mapping for Small-Scale Model Reasoning

通过问题空间映射解耦理解与推理以提升小型模型推理能力

Li Wang, Changhao Zhang, Zengqi Xiu, Kai Lu, Xin Yu, Kui Zhang, Wenjun Wu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 DURIT通过问题空间映射解耦理解和推理,提升小型模型在数学和逻辑推理任务中的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12656 2025-12-16 cs.LO 78%

Argumentative Reasoning with Language Models on Non-factorized Case Bases

基于非因子化案例库的语言模型论证推理

Wachara Fungwacharakorn, May Myo Zin, Ha-Thanh Nguyen, Yuntao Kong, Ken Satoh

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出AAM-CBR框架,通过语言模型实现非因子化案例库的基于案例推理,提升灵活性和隐私性,并展示在因素数量增加时需结合符号推理以提高效果。

Comments Presented at NeLaMKRR@KR, 2025 (arXiv:2511.09575)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13668 2025-12-16 cs.LG 77%

A Scientific Reasoning Model for Organic Synthesis Procedure Generation

有机合成过程生成的科学推理模型

Guoqing Liu, Junren Li, Zihan Zhao, Eray Inanc, Krzysztof Maziarz, Jose Garrido Torres, Victor Garcia Satorras, Shoko Ueda, Christopher M. Bishop, Marwin Segler

机构 * Microsoft Research AI for Science(微软研究院人工智能科学部) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 QFANG通过化学引导推理框架生成高质量合成程序,提升计算机辅助合成规划与自动化实验室合成的衔接。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02580 2025-12-16 cs.CL 77%

From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks

从模仿到辨别:一种通用的课程优势机制,增强跨领域推理任务

Changpeng Yang, Jinyang Wu, Yuchen Liu, Shuai Zhang, Yang Li, Qiliang Liang, Hongzhen Wang, Shuai Nie, Jiaming Xu, Runyu Shi, Ying Huang, Guoquan Zhang

机构 * \equalcontrib(1号机构)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 CAPO是一种基于优势信号的自适应课程机制,通过引导模仿学习和引入负信号提升跨领域推理任务的泛化能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20164 2025-12-16 cs.CL 77%

Thinking with Visual Abstract: Enhancing Multimodal Reasoning via Visual Abstraction

通过视觉抽象思考:通过视觉抽象增强多模态推理

Dairu Liu, Ziyue Wang, Minyuan Ruan, Fuwen Luo, Chi Chen, Peng Li, Yang Liu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 通过引入视觉抽象思考范式,提升多模态大语言模型在视觉感知和推理任务中的性能,实现更高效的视觉推理机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12154 2025-12-16 cs.CR cs.LG 77%

Keep the Lights On, Keep the Lengths in Check: Plug-In Adversarial Detection for Time-Series LLMs in Energy Forecasting

保持灯光亮起,保持长度在控制中:用于能源预测时间序列LLM的插件对抗检测

Hua Ma, Ruoxi Sun, Minhui Xue, Xingliang Yuan, Carsten Rudolph, Surya Nepal, Ling Liu

机构 * The University of Melbourne, Australia(墨尔本大学) Monash University, Australia(莫纳什大学) Georgia Institute of Technology, United States(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种用于时间序列LLM的插件对抗检测方法,通过采样诱导的分歧检测对抗性示例,提升能源预测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11943 2025-12-16 cs.MA cs.AI econ.GN q-fin.EC 77%

How AI Agents Follow the Herd of AI? Network Effects, History, and Machine Optimism

AI代理如何跟随AI的群体?网络效应、历史与机器乐观

Yu Liu, Wenwen Li, Yifan Dou, Guangnan Ye

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究探讨AI代理在网络效应游戏中的决策行为,发现历史数据对LLM推理有显著影响,揭示了AI系统中均衡结果受历史塑造而非单纯激励驱动的特性。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13106 2025-12-16 cs.LG cs.AI 76%

TraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM Reasoning

TraPO:一种用于提升大语言模型推理能力的半监督强化学习框架

Shenzhi Yang, Guangcheng Zhu, Xing Zheng, Yingfan MA, Zhongqi Chen, Bowen Song, Weiqiang Wang, Junbo Zhao, Gang Chen, Haobo Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :LLM(title);分类 cs.AI、cs.LG

AI总结 TraPO通过结合少量标注样本与大量未标注样本,提升大语言模型在数学推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14642 2025-12-16 cs.CV 75%

Relation-R1: Progressively Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relation Comprehension

Relation-R1: 逐步认知链式思维引导的强化学习用于统一关系理解

Lin Li, Wei Chen, Jiahui Li, Kwang-Ting Cheng, Long Chen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract)

AI总结 Relation-R1通过整合认知链式思维引导的强化学习,实现了对二元和N元关系的统一理解,提升了视觉-语义定位能力。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11909 2025-12-16 cs.AI 74%

Causal Strengths and Leaky Beliefs: Interpreting LLM Reasoning via Noisy-OR Causal Bayes Nets

因果强度与渗漏信念:通过噪声-或因果贝叶斯网络解读LLM推理

Hanna Dettki

机构 * New York University(纽约大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.AI

AI总结 本文通过噪声-或因果贝叶斯网络评估LLM和人类在因果推理任务中的表现,探讨其因果强度和信念差异。

Journal ref WiML Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12777 2025-12-16 cs.CL cs.AI 73%

State over Tokens: Characterizing the Role of Reasoning Tokens

令牌上的状态:阐明推理令牌的作用

Mosh Levy, Zohar Elyoseph, Shauli Ravfogel, Yoav Goldberg

机构 * Bar-Ilan University(巴伊兰大学) University of Haifa(海法大学) New York University(纽约大学) Allen Institute for AI(人工智能研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SoT框架,将LLM的推理令牌视为外部化计算状态,而非文本叙述,以揭示其实际推理机制及未被关注的研究问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02454 2025-12-16 cs.CL cs.AI 73%

Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework

多模态深度研究员:从零开始生成文本-图表交织报告的代理框架

Zhaorui Yang, Bo Pan, Han Wang, Yiyao Wang, Xingyu Liu, Luoxuan Weng, Yingchaojie Feng, Haozhe Feng, Minfeng Zhu, Bo Zhang, Wei Chen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 多模态深度研究员通过代理框架实现从零开始生成文本-图表交织报告,利用FDV结构化文本表示提升可视化生成质量。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09810 2025-12-16 cs.AI 70%

Towards a Common Framework for Autoformalization

迈向自动形式化的一个共同框架

Agnieszka Mensfelt, David Tena Cucala, Santiago Franco, Angeliki Koutsoukou-Argyraki, Vince Trencsenyi, Kostas Stathis

机构 * Department of Computer Science, Royal Holloway, University of London(伦敦大学皇家霍洛威学院计算机科学系) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文旨在提出一个统一框架,以促进不同领域之间的交叉融合,推动下一代人工智能系统的发展。

Comments Presented at NeLaMKRR@KR, 2025 (arXiv:2511.09575). A shorter version of this work will appear in the Proceedings of the AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08768 2025-12-16 cs.CL 70%

AraReasoner: Evaluating Reasoning-Based LLMs for Arabic NLP

AraReasoner: 评估基于推理的LLM在阿拉伯语NLP中的表现

Ahmed Hasanaath, Aisha Alansari, Ahmed Ashraf, Chafik Salmane, Hamzah Luqman, Saad Ezzini

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学) SDAIA–KFUPM Joint Research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心) Mohammed VI Polytechnic University(穆莱·易卜拉欣(polytechnic)大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AraReasoner评估基于推理的LLM在阿拉伯语NLP中的表现,发现通过精心选择示例可显著提升分类任务性能,DeepSeek在复杂推理任务中表现优于GPT基线,LoRA微调进一步提升F1和BLEU分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21320 2025-12-16 cs.CL 70%

SciReasoner: Laying the Scientific Reasoning Ground Across Disciplines

SciReasoner: 跨学科的科学推理基础

Yizhou Wang, Chen Tang, Han Deng, Jiabei Xiao, Jiaqi Liu, Jianyu Wu, Jun Yao, Pengze Li, Encheng Su, Lintao Wang, Guohang Zhuang, Yuchen Ren, Ben Fei, Ming Hu, Xin Chen, Dongzhan Zhou, Junjun He, Xiangyu Yue, Zhenfei Yin, Jiamin Wu, Qihao Zheng, Yuhao Zhou, Huihui Xu, Chenglong Ma, Yan Lu, Wenlong Zhang, Chunfeng Song, Philip Torr, Shixiang Tang, Xinzhu Ma, Wanli Ouyang, Lei Bai

专题命中 推理与问题求解 :foundation model(abstract);SFT(abstract);分类 cs.CL

AI总结 SciReasoner通过跨学科学习提升科学推理能力,支持多种任务,增强跨领域泛化和准确性。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14829 2025-12-16 cs.CL 70%

Measuring Chain of Thought Faithfulness by Unlearning Reasoning Steps

通过反向学习推理步骤来衡量推理链的忠实性

Martin Tutek, Fateme Hashemi Chaleshtori, Ana Marasović, Yonatan Belinkov

机构 * Technion - Israel Institute of Technology(技术学院-以色列理工学院) University of Utah(犹他大学)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.CL

AI总结 通过反向学习推理步骤来评估推理链的参数忠实性,揭示模型推理与预测之间的关系。

Comments Outstanding paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01700 2025-12-16 cs.AI 70%

DeepVIS: Bridging Natural Language and Data Visualization Through Step-wise Reasoning

DeepVIS: 通过分步推理连接自然语言与数据可视化

Zhihao Shuai, Boyan Li, Siyu Yan, Yuyu Luo, Weikai Yang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DeepVIS通过整合分步推理提升自然语言到可视化的质量,提供透明的推理过程以增强用户理解与调整能力。

Comments IEEE VIS 2025 full paper

Journal ref IEEE Transactions on Visualization and Computer Graphics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏