arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-03 至 2025-12-03 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 26 篇

2512.02246 2025-12-03 cs.CL cs.AI 91%

DETAIL Matters: Measuring the Impact of Prompt Specificity on Reasoning in Large Language Models

DETAIL 重要性:测量提示特定性对大语言模型推理的影响

Olivia Kim

机构 * Emory University(埃默里大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文通过DETAIL框架研究提示特定性对大语言模型推理性能的影响,发现特定性提升准确性,尤其对小型模型和程序性任务效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07646 2025-12-03 cs.CL cs.AI 90%

On the Temporal Question-Answering Capabilities of Large Language Models Over Anonymized Data

大型语言模型在匿名数据上的时间问答能力研究

Alfredo Garrachón Ruiz, Tomás de la Rosa, Daniel Borrajo

机构 * AI Research, JP Morgan Chase(人工智能研究, 花旗集团)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大型语言模型在匿名数据上的时间推理能力,开发了RATA数据集并比较了多种方法,发现需要集成方法而非单一LLM。

Comments 18 pages, 7 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02499 2025-12-03 cs.AI 89%

COPE: Chain-Of-Thought Prediction Engine for Open-Source Large Language Model Based Stroke Outcome Prediction from Clinical Notes

COPE:基于开源大语言模型的链式推理预测引擎用于从临床笔记预测中风结局

Yongkai Liu, Helena Feng, Bin Jiang, Yixin Wang, Max Wintermark, David S. Liebeskind, Michael Moseley, Maarten Lansberg, Gregory Albers, Jeremy Heit, Greg Zaharchuk

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 COPE通过链式推理框架从临床笔记预测中风预后,优于现有模型,提供轻量级且可解释的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02987 2025-12-03 cs.CL cs.AI 88%

Fine-Tuned Large Language Models for Logical Translation: Reducing Hallucinations with Lang2Logic

针对逻辑翻译的微调大型语言模型:通过Lang2Logic减少幻觉

Muyu Pan, Dheeraj Kodakandla, Mahfuza Farooque

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种通过微调大型语言模型来减少逻辑翻译中幻觉的框架,利用自定义语法和符号计算库生成可靠的合取范式。

Comments IEEE ISNCC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02677 2025-12-03 cs.AI 88%

Exploring Depth Generalization in Large Language Models for Solving Recursive Logic Tasks

探索大型语言模型在解决递归逻辑任务中的深度泛化能力

Zhiyuan He

机构 * Zhiyuan He(He)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究提出了一种循环定位和替换流程,用于解决大型语言模型在递归逻辑任务中的深度泛化问题,通过分解递归问题并利用两个专门模型提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02841 2025-12-03 cs.CL cs.AI cs.HC cs.LG 87%

Cross-Lingual Prompt Steerability: Towards Accurate and Robust LLM Behavior across Languages

跨语言提示引导性:迈向跨语言的准确且稳健的大语言模型行为

Lechen Zhang, Yusheng Zhou, Tolga Ergen, Lajanugen Logeswaran, Moontae Lee, David Jurgens

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) LG AI Research(LG人工智能研究)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种统一的四维评估框架,通过大规模实验揭示了提示组件对跨语言行为的影响,并开发了提示优化框架以提升多语言LLM的准确性和稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01830 2025-12-03 cs.CV 87%

OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic

OpenREAD: 基于LLM作为批评者的开放性推理端到端自动驾驶框架

Songyan Zhang, Wenhui Huang, Zhan Chen, Chua Jiahao Collister, Qihang Huang, Chen Lv

机构 * Nanyang Technological University, Singapore(南洋理工大学) Harvard University, USA(哈佛大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 OpenREAD通过端到端强化微调框架,结合LLM作为批评者,提升自动驾驶中的推理与规划能力,实现从高层推理到低层轨迹规划的全面优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16264 2025-12-03 cs.CL cs.AI cs.HC cs.LG 86%

ParlAI Vote: A Web Platform for Analyzing Gender and Political Bias in Large Language Models

ParlAI Vote:一个用于分析大型语言模型中性别和政治偏见的网络平台

Wenjie Lin, Hange Liu, Yingying Zhuang, Xutao Mao, Jingwei Shi, Xudong Han, Tianyu Shi, Jinrui Yang

机构 * Purdue University(普渡大学) Johns Hopkins University(约翰霍普金斯大学) Vanderbilt University(范德比大学) University of Toronto(多伦多大学) The University of Melbourne(墨尔本大学)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 ParlAI Vote是一个用于分析大型语言模型中性别和政治偏见的网络平台,通过可视化和交互功能揭示LLMs在政治分析中的系统性偏见。

Comments online demo: https://euro-parl-vote-demo.vercel.app/; Video: https://www.youtube.com/@Jinrui-sf2jg

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13352 2025-12-03 cs.AI cs.RO 85%

Agentic UAVs: LLM-Driven Autonomy with Integrated Tool-Calling and Cognitive Reasoning

智能无人机:基于大语言模型的自主性与集成工具调用和认知推理

Anis Koubaa, Khaled Gabr

机构 * AlfaisalX: Center of Excellence of Cognitive Robotics and Autonomous Agents(阿尔法西尔研究中心:认知机器人与自主代理中心) Alfaisal University(阿尔法西尔大学) Prince Sultan University(普森大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Agentic UAVs框架,利用大语言模型实现无人机的高自主性与外部系统集成,通过模拟实验验证其在搜索救援任务中的有效性。

Comments 17 pages, 2 figure

Journal ref The International Conference on Smart Systems and Emerging Technologies (SmartTech 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02389 2025-12-03 cs.AI cs.LG 84%

Synthetic Error Injection Fails to Elicit Self-Correction In Language Models

合成错误注入无法在语言模型中引发自我修正

David X. Wu, Shreyas Kapur, Anant Sahai, Stuart Russell

机构 * ucb(伯克利大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现合成错误注入无法有效提升语言模型的自我修正能力,揭示了策略性强化学习在激发自我修正方面的独特优势。

Comments 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01155 2025-12-03 cs.SE cs.AI 81%

Beyond Greenfield: The D3 Framework for AI-Driven Productivity in Brownfield Engineering

超越Greenfield:面向Brownfield工程的D3框架:AI驱动的生产力框架

Krishna Kumaar Sharma

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出D3框架,通过双代理提示架构提升Brownfield工程中LLM的应用效果,实验证明在遗留系统探索、文档重建等任务中,AI辅助显著提升生产力和减少认知负荷。

Comments 53 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17238 2025-12-03 cs.LG 81%

Training a Scientific Reasoning Model for Chemistry

为化学训练一个推理模型

Siddharth M. Narayanan, James D. Braza, Ryan-Rhys Griffiths, Albert Bou, Geemi Wellawatte, Mayk Caldas Ramos, Ludovico Mitchener, Samuel G. Rodriques, Andrew D. White

机构 * FutureHouse Inc.(FutureHouse公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出了一种基于强化学习的推理模型,用于化学领域,能高效处理多种化学任务,超越现有模型和人类专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02405 2025-12-03 cs.CV cs.AI cs.LG 79%

WISE: Weighted Iterative Society-of-Experts for Robust Multimodal Multi-Agent Debate

WISE: 加权迭代专家社会用于鲁棒多模态多智能体辩论

Anoop Cherian, River Doyle, Eyal Ben-Dov, Suhas Lohit, Kuan-Chuan Peng

机构 * Mitsubishi Electric Research Labs(三菱电机研究实验室) Cambridge Rindge and Latin School(剑桥林恩和拉丁学校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WISE框架,通过多模态多智能体辩论提升视觉语言推理任务的准确性,实验显示在多个数据集上提升了2-7%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02185 2025-12-03 cs.CL cs.AI cs.LG 78%

Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models

在行动前剪枝:面向推理语言模型的自反思结构剪枝

Ziyan Wang, Enmao Diao, Qi Le, Pu Wang, Guanchu Wang, Minwoo Lee, Shu-ping Yeh, Li Yang

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of Minnesota(明尼苏达大学) Intel Corporation(英特尔公司)

专题命中 推理与问题求解 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 RESP通过自反思结构化剪枝框架,在保持推理连贯性的同时显著提升稀疏度下的性能

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00360 2025-12-03 cs.PL 78%

ChopChop: a Programmable Framework for Semantically Constraining the Output of Language Models

ChopChop: 一种可编程框架,用于对语言模型输出进行语义约束

Shaan Nagy, Timothy Zhou, Nadia Polikarpova, Loris D'Antoni

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 ChopChop是一种可编程框架,通过语义约束提升语言模型输出的正确性和类型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02340 2025-12-03 cs.AI cs.CV 77%

Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective

多视角视觉空间推理的推理路径与潜在状态分析:从认知科学视角

Qiyao Xue, Weichen Liu, Shiqi Wang, Haoming Wang, Yuyang Wu, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 ReMindView-Bench从认知科学视角评估VLMs在多视角空间推理中的表现,揭示其在跨视角对齐和视角取向方面的不足。

Comments 23 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02321 2025-12-03 cs.CR cs.CL 77%

LeechHijack: Covert Computational Resource Exploitation in Intelligent Agent Systems

LeechHijack: 智能代理系统中的隐蔽计算资源利用

Yuanhe Zhang, Weiliu Wang, Zhenhong Zhou, Kun Wang, Jie Zhang, Li Sun, Yang Liu, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Hangzhou Dianzi University(杭州电子科技大学) Nanyang Technological University(南洋理工大学) CFAR North China Electric Power University(华北电力大学) Chongqing University of Posts(重庆邮电大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LeechHijack通过隐式毒性攻击利用MCP框架中的信任边界,隐蔽劫持代理计算资源,揭示对计算溯源和资源认证机制的迫切需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07424 2025-12-03 cs.HC 75%

Feed-O-Meter: Investigating AI-Generated Mentee Personas as Interactive Agents for Scaffolding Design Feedback Practice

Feed-O-Meter:探究AI生成的指导者人设作为交互代理在支架设计反馈实践中的应用

Hyunseung Lim, Dasom Choi, DaEun Choi, Sooyohn Nam, Hwajung Hong

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Feed-O-Meter通过AI代理帮助学生练习设计反馈,提升其反馈能力和反思能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02306 2025-12-03 cs.AI cs.CL cs.CR cs.CV cs.LG 75%

OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning

OmniGuard:统一的多模态防护机制与刻意推理

Boyu Zhu, Xiaofei Wen, Wenjie Jacky Mo, Tinghui Zhu, Yanan Xie, Peng Qi, Muhao Chen

机构 * Fudan University(复旦大学) University of California, Davis(加州大学戴维斯分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OmniGuard通过统一的多模态防护机制与刻意推理能力,有效提升多模态安全防护的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02699 2025-12-03 cs.AI 70%

Learning What to Attend First: Modality-Importance-Guided Reasoning for Reliable Multimodal Emotion Understanding

学习优先关注什么:模态重要性引导的推理用于可靠的多模态情感理解

Hyeongseop Rha, Jeong Hun Yeo, Junil Won, Se Jin Park, Yong Man Ro

机构 * Integrated Vision and Language Lab, KAIST, South Korea(韩国成均馆大学集成视觉与语言实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MIGR框架,通过模态重要性引导推理,提升多模态情感理解的可靠性,实验表明能有效减少情感不一致的解释实例。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02660 2025-12-03 cs.AI cs.AR 70%

Hey AI, Generate Me a Hardware Code! Agentic AI-based Hardware Design & Verification

嘿,AI,为我生成一段硬件代码!基于代理的AI硬件设计与验证

Deepak Narayan Gadde, Keerthan Kopparam Radhakrishna, Vaisakh Naduvodi Viswambharan, Aman Kumar, Djones Lettnin, Wolfgang Kunz, Sebastian Simon

机构 * 1 Infineon Technologies Dresden GmbH \& Co. KG, Germany 2 Infineon Technologies India Pvt. Ltd., India 3 Infineon Technologies AG, Germany 4 Rheinland-Pf \"a lzische Technische Universit \"a t Kaiserslautern-Landau, Germany

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于代理的AI方法,用于硬件设计验证,通过与人类在环的协作,实现动态迭代和自我反思,提升设计覆盖率并减少验证时间。

Comments To appear at the 38th SBC/SBMicro/IEEE Symposium on Integrated Circuits and Systems Design (SBCCI), August 25-29, 2025, Manaus, BRAZIL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11275 2025-12-03 cs.MM cs.AI cs.CY 70%

TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs

TCC-Bench:评估多模态大语言模型对传统中国文化理解能力的基准测试

Pengju Xu, Yan Wang, Shuyuan Zhang, Xuan Zhou, Xin Li, Yue Yuan, Fengzhao Li, Shunyuan Zhou, Xingyu Wang, Yi Zhang, Haiying Zhao

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TCC-Bench通过双语视觉问答基准评估多模态大语言模型对传统中国文化理解能力,揭示其在文化相关视觉内容推理上的挑战。

Comments There are issues with the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13127 2025-12-03 cs.CL 70%

Facilitating Long Context Understanding via Supervised Chain-of-Thought Reasoning

通过监督的链式思维推理促进长上下文理解

Jingyang Lin, Andy Wong, Tian Xia, Shenghua He, Hui Wei, Mei Han, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) PAII Inc.(PAII公司) University of California, Merced(加州梅尔德大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于属性的代理推理框架PAI,通过生成包含中间推理步骤的合成数据集LongFinanceQA,提升LLMs在金融领域的长上下文理解能力。

Comments Main Conference of EMNLP 2025, Project Page: https://long-pai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02715 2025-12-03 cs.CV 67%

GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding

GeoViS: 基于地理奖励的视觉搜索用于遥感视觉定位

Peirong Zhang, Yidan Zhang, Luxiao Xu, Jinliang Lin, Zonghao Guo, Fengxiang Wang, Xue Yang, Kaiwen Wei, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) National University of Defense Technology(国防科技大学) Shanghai Jiao Tong University(上海交通大学) Chongqing University(重庆大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 GeoViS通过地理奖励机制,实现了遥感影像中的细粒度视觉定位,通过逐步搜索和推理提升小目标检测精度与跨领域泛化能力。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02835 2025-12-03 cs.CV cs.AI cs.CL 62%

ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning

ReVSeg:通过强化学习激励视频分割的推理链

Yifan Li, Yingda Yin, Lingting Zhu, Weikai Chen, Shengju Qian, Xin Wang, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) LIGHTSPEED

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 ReVSeg通过强化学习优化视频分割的多步推理链,实现可解释的推理轨迹和先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02361 2025-12-03 cs.CV cs.AI 57%

VACoT: Rethinking Visual Data Augmentation with VLMs

VACoT:重新思考视觉数据增强与VLMs

Zhengzhuo Xu, Chong Sun, SiNan Du, Chen Li, Jing Lyu, Chun Yuan

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc(腾讯微信视觉部门)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 VACoT通过在推理过程中动态调用图像增强,提升VLMs在挑战性和分布外输入中的鲁棒性,特别是在OCR对抗场景中,通过高效的智能强化学习减少训练开销并增强感知任务的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏