arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18936 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18936 篇

2509.23108 2026-05-20 cs.AI cs.CL 88%

Artificial Phantasia: Emergent Mental Imagery in Large Language Models

人工幻象:大语言模型中的涌现性心智 imagery

Morgan McCarty, Jorge Morales

机构 * Khoury College of Computer Sciences, Northeastern University(东北大学克劳利计算机科学学院) Department of Psychology, Northeastern University(东北大学心理学系) Department of Philosophy, Northeastern University(东北大学哲学系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了纯语言能否驱动视觉 imagery,发现大语言模型在视觉 imagery 任务中表现优于人类,表明可能存在非图示性的涌现性心智 imagery,挑战传统认知科学观点。

Comments 34 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16727 2026-05-19 cs.CL cs.AI 88%

Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models

Beacon:单轮诊断和缓解大型语言模型中潜在的阿谀倾向

Sanskar Pandey, Ruhaan Chopra, Angkul Puniya, Sohom Pal

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Beacon基准测试,用于单轮诊断和缓解大型语言模型中潜在的阿谀倾向,通过评估十二种最先进的模型,揭示了阿谀倾向在语言和情感方面的稳定子偏差,并提出了在提示和激活层面的干预措施,以调节这些偏差,从而揭示对齐作为事实性和社会合规判断之间的动态流形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17214 2026-05-19 cs.AI cs.CL cs.CV 88%

ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding

ChemVA:推动大型语言模型在化学反应图示理解上的进步

Mingyang Rao, Kehua Feng, Zhihui Zhu, Jiangzhen Fu, Hao Yu, Keyan Ding, Huajun Chen

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科学与技术创新中心) Department of Chemistry, Fudan University(复旦大学化学系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文针对现有系统在理解化学反应图示时存在的视觉缺陷和语义断开问题,提出ChemVA框架,通过视觉锚机制和语义对齐方法提升大型语言模型在化学推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16824 2026-05-19 cs.LG cs.CL 88%

Confidence Geometry Reveals Trace-Level Correctness in Large Language Model Reasoning

置信几何揭示大语言模型推理中的痕量正确性

Shuo Liu, Ding Liu, Shi-Ju Ran

机构 * School of Computer Science and Technology, Tiangong University(天津工业大学计算机科学与技术学院) Center for Quantum Physics and Intelligent Sciences, Department of Physics, Capital Normal University(首都师范大学量子物理与智能科学中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了大语言模型推理正确性与置信轨迹之间的关系,提出通过置信几何分析来区分正确与错误推理轨迹,并展示了NeuralConf方法在提高推理准确性方面的有效性。

Comments 11 pages, 9 figures, 1 table. Code is available at https://github.com/QML-TGU/NeuralConf

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10931 2026-05-14 cs.LG cs.CL 88%

Asynchronous Reasoning: Training-Free Interactive Thinking LLMs

异步推理:无需训练的交互式思考LLM

George Yakushev, Nataliia Babina, Masoud Vahid Dastgerdi, Vyacheslav Zhdanovskiy, Denis Kuznedelev, Alina Shutova, Max Ryabinin

机构 * Yandex HSE University(俄罗斯高等经济大学) The University of Tokyo(东京大学) MATS Together AI

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种无需额外训练的LLM异步推理方法,通过位置嵌入特性实现同时思考、倾听和生成输出,提升数学、常识和安全推理任务的准确性和响应速度。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12446 2026-05-13 cs.LG cs.CL 88%

ORCE: Order-Aware Alignment of Verbalized Confidence in Large Language Models

ORCE:面向大型语言模型中明确自信度的顺序感知对齐

Chen Li, Xiaoling Hu, Songzhu Zheng, Jiawei Zhou, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院) Morgan Stanley(摩根大通)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种解耦且顺序感知的明确自信度校准框架,通过分离自信度估计与答案生成过程,提升校准和失败预测性能,同时保持答案准确性。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13988 2026-05-13 cs.AI cs.LG 88%

Faithful or Just Plausible? Evaluating the Faithfulness of Closed-Source LLMs in Medical Reasoning

忠实还是只是合理?评估闭源LLM在医学推理中的忠实性

Halimat Afolabi, Zainab Afolabi, Elizabeth Friel, Jude Roberts, Antonio Ji-Xu, Lloyd Chen, Egheosa Ogbomo, Emiliomo Imevbore, Phil Eneje, Wissal El Ouahidi, Aaron Sohal, Alisa Kennan, Shreya Srivastava, Anirudh Vairavan, Laura Napitu, Katie McClure

机构 * Stratified Precision Harvard Medical School(哈佛医学院) Imperial College London(帝国理工学院伦敦分校) National Health Service(国家健康服务系统) Ipsen France(Ipsen法国) University College London(伦敦大学学院)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过系统性黑盒评估,揭示闭源LLM在医学推理中的忠实性问题,发现链式推理步骤未必驱动预测,模型易受外部提示影响,强调忠实性比准确性更重要。

Journal ref Proceedings of Machine Learning Research, Vol. 297, pp. 1562-1591, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10082 2026-05-13 cs.CL cs.LG 88%

FERA: Uncertainty-Aware Federated Reasoning for Large Language Models

FERA:面向大语言模型的不确定性感知联邦推理

Ruhan Wang, Chengkai Huang, Zhiyong Wang, Junda Wu, Rui Wang, Tong Yu, Julian McAuley, Lina Yao, Dongruo Zhou

机构 * Indiana University(印第安纳大学) The University of New South Wales(新南威尔士大学) The Chinese University of Hong Kong(香港中文大学) University of California San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 FERA通过迭代服务器-客户端协同细化,解决联邦推理中客户端可靠性依赖查询的问题,提升多步骤推理能力,实验表明其在多个推理基准上优于联邦训练和无训练基线。

Comments 44 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02079 2026-05-08 cs.CL cs.AI 88%

Argumentative Large Language Models for Explainable and Contestable Claim Verification

用于可解释和可争议主张验证的论证大型语言模型

Gabriel Freedman, Adam Dejl, Deniz Gorur, Xiang Yin, Antonio Rago, Francesca Toni

机构 * Department of Computing, Imperial College London, UK(伦敦帝国学院计算机系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出论证大型语言模型(ArgLLMs),通过引入论证推理增强LLMs,使其决策可解释且可争议,通过实验验证其在主张验证任务中的性能。

Comments 18 pages, 18 figures. Accepted as an oral presentation at AAAI 2025

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 39(14), 14930-14939. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07731 2026-05-05 cs.AI cs.CL 88%

oMeBench: Towards Robust Benchmarking of LLMs in Organic Mechanism Elucidation and Reasoning

oMeBench:面向有机机制阐明和推理的鲁棒基准测试

Ruiling Xu, Yifan Zhang, Qingyun Wang, Carl Edwards, Heng Ji

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出oMeBench,首个大规模专家 curated 的有机机制推理基准,包含10000+注释步骤,评估LLM在化学一致性与多步推理能力,发现通过提示策略和领域微调可使性能提升50%。

Comments We need adjust some authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00436 2026-05-04 cs.CL cs.AI 88%

Impact of Task Phrasing on Presumptions in Large Language Models

任务表述对大语言模型中假设的影响

Kenneth J. K. Ong

机构 * AI.DA STC ST Engineering(AI.DA STC ST工程)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 研究探讨了任务表述如何导致大语言模型产生假设,影响其适应能力,通过囚徒困境实验发现中性表述可减少假设影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23296 2026-04-28 cs.CL cs.AI 88%

$\mathcal{S}^2$IT: Stepwise Syntax Integration Tuning for Large Language Models in Aspect Sentiment Quad Prediction

$\mathcal{S}^2$IT:面向大语言模型的方面情感四元预测的分步语法整合调优

Bingfeng Chen, Chenjie Qiu, Yifeng Xie, Boyan Xu, Ruichu Cai, Zhifeng Hao

机构 * School of Computer Science, Guangdong University of Technology(广东技术大学计算机科学学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Peng Cheng Laboratory(鹏城实验室) College of Science, Shantou University(汕头大学理学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出S^2IT框架,通过分步调优整合语法结构信息,提升大语言模型在方面情感四元预测中的性能,实验表明其在多个数据集上表现优异。

Comments Accepted to Findings of NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20878 2026-04-24 cs.CL cs.CV cs.LG eess.IV 88%

AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models

AITP:通过多模态大语言模型进行交通事故责任分配

Zijin Zhou, Songan Zhang

机构 * Global Institute of Future Technology(未来技术全球研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出AITP模型,结合多模态链式推理和法律知识检索,解决交通事故责任分配问题,并构建DecaTARA基准测试集,验证模型在责任分配、事故检测和理解任务中的领先性能。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06209 2026-04-24 cs.AI cs.CL 88%

ReProbe: Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models

ReProbe:通过探测大语言模型的内部状态实现多步骤推理的高效测试时间扩展

Jingwei Ni, Ekaterina Fadeeva, Tianyi Wu, Mubashara Akhtar, Jiaheng Zhang, Elliott Ash, Markus Leippold, Timothy Baldwin, See-Kiong Ng, Artem Shelmanov, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院) National University of Singapore(新加坡国立大学) MBZUAI(马斯喀特人工智能研究所) University of Zürich(苏黎世大学) The University of Melbourne(墨尔本大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出基于探测大语言模型内部状态的轻量级方法,用于多步骤推理验证,其性能超越了810倍大的Process Reward Models,为可扩展的测试时间扩展和更可 introspective 的大语言模型提供了新路径。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24239 2026-04-24 cs.LG cs.AI 88%

ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models

ChessArena: 一个用于评估大语言模型战略推理能力的国际象棋测试平台

Jincheng Liu, Sijun He, Jingjing Wu, Xiangsen Wang, Yang Chen, Zhaoqi Kuang, Siqi Bao, Yuan Yao

机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室) Baidu(百度) University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ChessArena测试平台,用于评估大语言模型的战略推理能力,测试了13个模型在800多局游戏中表现,发现无模型能击败业余水平的Maia-1100,但经过微调的Qwen3-8B模型表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19638 2026-04-22 cs.AI cs.CL cs.RO 88%

SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models

SafetyALFRED:评估多模态大语言模型的安全意识规划

Josue Torres-Fonseca, Naihao Deng, Yinpei Dai, Shane Storks, Yichi Zhang, Rada Mihalcea, Casey Kennington, Joyce Chai

机构 * University of Michigan(密歇根大学) Boise State University(博伊西州立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SafetyALFRED,基于ALFRED基准测试,引入六类厨房真实世界危险,评估多模态大语言模型在安全意识规划中的表现,发现静态QA评估不足,需转向强调具身环境中的纠正行动的基准。

Comments Work accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18463 2026-04-21 cs.AI cs.LG cs.RO 88%

Using large language models for embodied planning introduces systematic safety risks

使用大型语言模型进行具身规划引入了系统性的安全风险

Tao Zhang, Kaixian Qu, Zhibin Li, Jiajun Wu, Marco Hutter, Manling Li, Fan Shi

机构 * ETH Zurich(苏黎世联邦理工学院) University College London(伦敦大学学院) Stanford University(斯坦福大学) Northwestern University(西北大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究评估了大型语言模型在机器人规划中的安全性,发现即使规划能力高,安全风险仍显著存在,揭示了规划能力与安全意识之间的乘法关系。

Comments Project page: https://despite-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17159 2026-04-21 cs.CR cs.AI cs.CL 88%

Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks

前沿大语言模型在进攻性网络任务中的系统能力评估

Tyler H. Merves, Michael H. Conaway, Joseph M. Escobar, Hakan T. Otal, Unal Tatar

机构 * Department of Cybersecurity(网络安全系) Department of Information Sciences and Technology(信息科学与技术系) College of Emergency Preparedness, Homeland Security, and Cybersecurity(应急准备、国土安全与网络安全学院) University at Albany, SUNY(阿尔巴尼大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 本文系统评估了10个前沿大语言模型在进攻性网络任务中的表现,发现环境工具和模型选择是性能的主要驱动因素,而提示工程在装备良好的环境中效果下降。

Comments 6 pages, 4 figures. Submitted to the IEEE Systems and Information Engineering Design Symposium (SIEDS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08299 2026-04-21 cs.CL cs.AI 88%

SeLaR: Selective Latent Reasoning in Large Language Models

SeLaR:大语言模型中的选择性潜在推理

Renyu Fu, Guibo Luo

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸式媒体技术重点实验室) Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 SeLaR通过引入熵门机制和熵感知对比正则化,解决大语言模型中链式推理的稳定性与探索性问题,优于标准CoT和训练自由方法。

Comments Camera-ready for ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16995 2026-04-21 cs.CL cs.LG 88%

SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models

SPS:通过引导概率压缩在大型语言模型强化学习中的更好探索

Yifu Huo, Chenglong Wang, Ziming Zhu, Shunjie Xing, Peinan Feng, Tongran Liu, Qiaozhi He, Tianhua Zhou, Xiaojia Chang, Jingbo Zhu, Zhengtao Yu, Tong Xiao

机构 * Northeastern University(东北大学) CAS Key Laboratory of Behavioral Science(中国科学院行为科学重点实验室) Independent Researcher(独立研究员) Kunming University of Science and Technology(昆明理工大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出SPS方法,结合传统强化学习与逆强化学习,通过引导轨迹分布提升探索能力,改进多样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11140 2026-04-21 cs.CL cs.AI 88%

Follow the Path: Reasoning over Knowledge Graph Paths to Improve Large Language Model Factuality

跟随路径:通过知识图谱路径推理提升大语言模型事实性

Mike Zhang, Johannes Bjerva, Russa Biswas

机构 * University of Copenhagen(哥本哈根大学) Aalborg University(奥尔堡大学) Pioneer Centre for Artificial Intelligence(先锋人工智能中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出fs1方法,通过收集大推理模型的推理轨迹并将其锚定在知识图谱路径上,提升大语言模型的事实性,在六个复杂开放领域问答基准测试中表现优异。

Comments Accepted at ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14517 2026-04-20 cs.CL cs.LG 88%

Large Language Models for Math Education in Low-Resource Languages: A Study in Sinhala and Tamil

大型语言模型在低资源语言中的数学教育应用:斯里兰卡语和泰米尔语的研究

Sukumar Kishanthan, Kumar Thushalika, Buddhi Jayasekara, Asela Hevapathige

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of Moratuwa(穆拉图瓦大学) Department of Electrical and Information Engineering(电气与信息工程系) University of Ruhuna(鲁胡纳大学) Faculty of Information Technology and Communication Sciences(信息科技与通讯科学学院) Tampere University(塔尔皮奥大学) School of Computing(计算学院) Australian National University(澳大利亚国立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了大型语言模型在斯里兰卡语和泰米尔语中的数学推理能力,发现基础算术推理在不同语言间表现稳定,但复杂问题在两种语言中均有显著下降,表明英语表现佳不等于多语言可靠。

Comments Accepted to ITHET 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20020 2026-04-20 cs.AI cs.CL 88%

Persona-Assigned Large Language Models Exhibit Human-Like Motivated Reasoning

具有人格分配的大型语言模型表现出类似人类的动机推理

Saloni Dash, Amélie Reymond, Emma S. Spiro, Aylin Caliskan

机构 * University of Washington(华盛顿大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了分配不同政治和社会人口属性的人格对大型语言模型动机推理的影响,发现人格分配的模型在评估信息真实性时表现下降,且政治人格在科学证据评估中更倾向于与自身身份一致的结论,传统去偏方法效果有限。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14528 2026-04-17 cs.AI cs.CL 88%

Dissecting Failure Dynamics in Large Language Model Reasoning

解析大语言模型推理中的故障动态

Wei Zhu, Jian Zhang, Lixing Yu, Kun Yue, Zhiwen Tang

机构 * School of Information Science and Engineering, Yunnan University, Kunming, China(云南大学信息科学与工程学院,昆明,中国) Yunnan Key Laboratory of Intelligent Systems and Computing, Kunming, China(云南省智能系统与计算重点实验室,昆明,中国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大语言模型推理错误多源于早期少量转换点,提出GUARD框架通过不确定性信号引导干预,提升推理可靠性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10031 2026-04-14 cs.CL cs.AI 88%

CoSToM:Causal-oriented Steering for Intrinsic Theory-of-Mind Alignment in Large Language Models

CoSToM: 为大语言模型内在理论思维对齐的因果导向引导

Mengfan Li, Xuanhua Shi, Yang Deng

机构 * National Engineering Research Center for Big Data Technology and System, Services Computing Technology and System Lab, Cluster and Grid Computing Lab, Huazhong University of Science and Technology(华中科技大学国家大数据技术与系统工程技术研究中心、服务计算技术与系统实验室、集群与网格计算实验室) Singapore Management University(新加坡管理大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoSToM框架,通过因果追踪和激活引导提升大语言模型的社会推理能力与对话质量。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02231 2026-04-13 cs.CV cs.AI cs.LG 88%

See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models

看见、听见与理解:多模态大语言模型中人类语音理解基准测试

Le Thien Phuc Nguyen, Zhuoran Yu, Samuel Low Yu Hang, Subin An, Jeongik Lee, Yohan Ban, SeungEun Chung, Thanh-Huy Nguyen, JuWan Maeng, Soochahn Lee, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Kookmin University(国民大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出AV-SpeakerBench基准测试,通过3212道多选题评估多模态大语言模型在真实视频中对语音的细粒度理解能力,发现Gemini 2.5 Pro在音频视觉融合方面表现最佳。

Comments Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04942 2026-04-08 cs.CL cs.AI 88%

TDA-RC: Task-Driven Alignment for Knowledge-Based Reasoning Chains in Large Language Models

TDA-RC:基于任务驱动的知识推理链对齐方法

Jiaquan Zhang, Qigan Sun, Chaoning Zhang, Xudong Wang, Zhenzhen Huang, Yitian Zhou, Pengcheng Zheng, Chi-lok Andy Tai, Sung-Ho Bae, Zeyu Ma, Caiyan Qin, Jinyu Guo, Yang Yang, Hengtao Shen

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) College of Professional and Continuing Education, The Hong Kong Polytechnic University(香港理工大学专业及持续教育学院) School of Robotics and Advanced Manufacture, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)机电工程与自动化学院) School of Computing, Kyung Hee University(庆熙大学计算机学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出TDA-RC方法,通过拓扑学优化提升大语言模型推理效率与准确性,结合持久同调将不同推理范式统一到拓扑空间中,实现高效且精准的推理链优化。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09664 2026-04-08 cs.SE cs.AI cs.CL cs.PL 88%

CodeMind: Evaluating Large Language Models for Code Reasoning

CodeMind: 评估大型语言模型的代码推理能力

Changshu Liu, Yang Chen, Reyhaneh Jabbarvand

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CodeMind框架,通过独立执行推理、规范推理和动态语义推理任务评估LLM的代码推理能力,发现LLM在处理复杂代码时性能下降,且bug修复性能与代码推理任务无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00890 2026-04-02 cs.AI cs.CL cs.CV 88%

Beyond Symbolic Solving: Multi Chain-of-Thought Voting for Geometric Reasoning in Large Language Models

超越符号求解:用于大语言模型几何推理的多链式思维投票

Md. Abu Bakor Siddique, Shahrin Hossain, Sadman Ahmed Siam, Syed Rifat Raiyan, Hasan Mahmud, Md Kamrul Hasan

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MARS-GPS方法,通过生成多个并行推理流程并结合Python代码执行,利用熵值进行排序并多阶段投票,提升大语言模型在几何推理中的性能,实验显示其在Geometry3K数据集上达到88.8%的准确率,比现有最佳水平提升11%。

Comments Under review, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16553 2026-03-18 cs.CL cs.AI 88%

EmoLLM: Appraisal-Grounded Cognitive-Emotional Co-Reasoning in Large Language Models

EmoLLM:基于评估的认知-情感共推理在大语言模型中

Yifei Zhang, Mingyang Li, Henry Gao, Liang Zhao

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 EmoLLM通过引入评估推理图结构,实现认知与情感的协同推理,提升对话中情感状态和响应质量,同时保持事实可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏