arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-06 至 2026-01-06 共收录 264 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 54 篇

2601.02314 2026-01-06 cs.AI 87%

Project Ariadne: A Structural Causal Framework for Auditing Faithfulness in LLM Agents

Project Ariadne: 一种用于审计大语言模型代理忠实性的结构因果框架

Sourena Khanzadeh

机构 * Sourena Khanzadeh(独立研究者)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 Project Ariadne提出一种结构因果框架,通过因果干预评估大语言模型代理推理的忠实性,揭示代理推理与决策之间的因果脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05434 2026-01-06 cs.CL cs.AI 87%

LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models

LTLBench: 为评估大语言模型中的时间推理能力而设计的基准测试

Weizhi Tang, Kwabena Nuamah, Vaishak Belle

机构 * University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 LTLBench通过线性时序逻辑评估大语言模型的时间推理能力,构建包含2000个挑战的数据集并测试12个模型,揭示时间推理中的主要问题及复杂性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01546 2026-01-06 cs.AI 85%

Improving Behavioral Alignment in LLM Social Simulations via Context Formation and Navigation

通过情境形成与导航提升LLM社交模拟中的行为一致性

Letian Kong, Qianran, Jin, Renyu Zhang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过情境形成与导航提升LLM在复杂决策环境中的行为一致性,验证了两阶段框架在不同任务中的有效性。

Comments 39 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23489 2026-01-06 cs.AI 85%

The Gaining Paths to Investment Success: Information-Driven LLM Graph Reasoning for Venture Capital Prediction

投资成功的获取路径:基于信息驱动的LLM图推理的创业投资预测

Haoyu Pei, Zhongyang Liu, Xiangyi Xiao, Xiaocong Du, Suting Hong, Kunpeng Zhang, Haipeng Zhang

机构 * ShanghaiTech University(上海科技大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Maryland(马里兰大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MIRAGE-VC通过信息驱动的图路径推理,提升创业投资预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26122 2026-01-06 cs.CL 83%

Reasoning Path Divergence: A New Metric and Curation Strategy to Unlock LLM Diverse Thinking

推理路径分歧:一种新的度量和筛选策略,以解锁LLM多样化思考

Feng Ju, Zeyu Qin, Rui Min, Zhitao He, Lingpeng Kong, Yi R. Fung

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Science and Technology of China(中国科学技术大学) The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种新的训练范式1PNS和度量RPD,通过增加推理多样性提升LLM的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04308 2026-01-06 cs.RO cs.AI cs.CV 83%

RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics

RoboRefer: 向视觉语言模型在机器人中的空间指称推理迈进

Enshen Zhou, Jingkun An, Cheng Chi, Yi Han, Shanyu Rong, Chi Zhang, Pengwei Wang, Zhongyuan Wang, Tiejun Huang, Lu Sheng, Shanghang Zhang

机构 * School of Software, Beihang University(北京航空航天大学软件学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 推理与问题求解 :language model(title,abstract);SFT(abstract);分类 cs.AI

AI总结 RoboRefer通过整合深度编码器和强化微调方法,实现了视觉语言模型在机器人中的空间指称推理,提升了复杂场景下的交互能力。

Comments Accepted by NeurIPS 2025. Project page: https://zhoues.github.io/RoboRefer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12880 2026-01-06 cs.CL cs.AI 82%

nvBench 2.0: Resolving Ambiguity in Text-to-Visualization through Stepwise Reasoning

nvBench 2.0:通过分步推理解决文本到可视化中的歧义

Tianqi Luo, Chuhan Huang, Leixian Shen, Boyan Li, Shuyu Shen, Wei Zeng, Nan Tang, Yuyu Luo

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 nvBench 2.0通过分步推理解决文本到可视化中的歧义问题,提出Step-Text2Vis模型在模糊场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01952 2026-01-06 cs.SE 82%

Context-Adaptive Requirements Defect Prediction through Human-LLM Collaboration

基于人类与大语言模型协作的上下文自适应需求缺陷预测

Max Unterbusch, Andreas Vogelsang

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract)

AI总结 本文提出基于人类与大语言模型协作的上下文自适应需求缺陷预测方法,通过反馈循环和少量样本学习提升预测性能,优于传统方法。

Comments Accepted at ICSE-NIER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01233 2026-01-06 cs.SE 82%

Atomizer: An LLM-based Collaborative Multi-Agent Framework for Intent-Driven Commit Untangling

Atomizer: 一种基于大语言模型的协作多智能体框架,用于意图驱动的复合提交解缠

Kangchen Zhu, Zhiliang Tian, Shangwen Wang, Mingyue Leng, Xiaoguang Mao

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 Atomizer通过意图导向的思考链策略和协作多智能体框架,有效解决复合提交解缠中的语义意图识别和多轮细化问题,提升解缠效果。

Comments Accepted by ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02147 2026-01-06 cs.CV cs.AI cs.LG 82%

BiPrompt: Bilateral Prompt Optimization for Visual and Textual Debiasing in Vision-Language Models

BiPrompt:面向视觉与文本去偏的双重视觉语言模型双向提示优化

Sunny Gupta, Shounak Das, Amit Sethi

专题命中 推理与问题求解 :language model(title);foundation model(abstract,comments);分类 cs.AI、cs.LG

AI总结 BiPrompt通过双重视觉语言模型双向提示优化,同时减轻视觉和文本中的非因果特征依赖,提升模型在分布偏移下的鲁棒性和因果推理能力。

Comments Accepted at the AAAI 2026 Workshop AIR-FM, Assessing and Improving Reliability of Foundation Models in the Real World

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06478 2026-01-06 cs.LG cs.AI 81%

Anytime-Valid Answer Sufficiency Certificates for LLM Generation via Sequential Information Lift

通过顺序信息提升实现LLM生成的任何时间有效性答案充分性证书

Sanjeda Akter, Ibne Farabi Shihab, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction & Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过顺序信息提升实现LLM生成的任何时间有效性答案充分性证书,利用经验动态形式提升方法,在减少生成长度的同时保持delta级误差控制,并通过轻量级正确性门提升端任务正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12948 2026-01-06 cs.CL cs.AI cs.LG 80%

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

DeepSeek-R1: 通过强化学习激励大语言模型的推理能力

DeepSeek-AI, Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Peiyi Wang, Qihao Zhu, Runxin Xu, Ruoyu Zhang, Shirong Ma, Xiao Bi, Xiaokang Zhang, Xingkai Yu, Yu Wu, Z. F. Wu, Zhibin Gou, Zhihong Shao, Zhuoshu Li, Ziyi Gao, Aixin Liu, Bing Xue, Bingxuan Wang, Bochao Wu, Bei Feng, Chengda Lu, Chenggang Zhao, Chengqi Deng, Chenyu Zhang, Chong Ruan, Damai Dai, Deli Chen, Dongjie Ji, Erhang Li, Fangyun Lin, Fucong Dai, Fuli Luo, Guangbo Hao, Guanting Chen, Guowei Li, H. Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Qu, Hui Li, Jianzhong Guo, Jiashi Li, Jiawei Wang, Jingchang Chen, Jingyang Yuan, Junjie Qiu, Junlong Li, J. L. Cai, Jiaqi Ni, Jian Liang, Jin Chen, Kai Dong, Kai Hu, Kaige Gao, Kang Guan, Kexin Huang, Kuai Yu, Lean Wang, Lecong Zhang, Liang Zhao, Litong Wang, Liyue Zhang, Lei Xu, Leyi Xia, Mingchuan Zhang, Minghua Zhang, Minghui Tang, Meng Li, Miaojun Wang, Mingming Li, Ning Tian, Panpan Huang, Peng Zhang, Qiancheng Wang, Qinyu Chen, Qiushi Du, Ruiqi Ge, Ruisong Zhang, Ruizhe Pan, Runji Wang, R. J. Chen, R. L. Jin, Ruyi Chen, Shanghao Lu, Shangyan Zhou, Shanhuang Chen, Shengfeng Ye, Shiyu Wang, Shuiping Yu, Shunfeng Zhou, Shuting Pan, S. S. Li, Shuang Zhou, Shaoqing Wu, Shengfeng Ye, Tao Yun, Tian Pei, Tianyu Sun, T. Wang, Wangding Zeng, Wanjia Zhao, Wen Liu, Wenfeng Liang, Wenjun Gao, Wenqin Yu, Wentao Zhang, W. L. Xiao, Wei An, Xiaodong Liu, Xiaohan Wang, Xiaokang Chen, Xiaotao Nie, Xin Cheng, Xin Liu, Xin Xie, Xingchao Liu, Xinyu Yang, Xinyuan Li, Xuecheng Su, Xuheng Lin, X. Q. Li, Xiangyue Jin, Xiaojin Shen, Xiaosha Chen, Xiaowen Sun, Xiaoxiang Wang, Xinnan Song, Xinyi Zhou, Xianzu Wang, Xinxia Shan, Y. K. Li, Y. Q. Wang, Y. X. Wei, Yang Zhang, Yanhong Xu, Yao Li, Yao Zhao, Yaofeng Sun, Yaohui Wang, Yi Yu, Yichao Zhang, Yifan Shi, Yiliang Xiong, Ying He, Yishi Piao, Yisong Wang, Yixuan Tan, Yiyang Ma, Yiyuan Liu, Yongqiang Guo, Yuan Ou, Yuduan Wang, Yue Gong, Yuheng Zou, Yujia He, Yunfan Xiong, Yuxiang Luo, Yuxiang You, Yuxuan Liu, Yuyang Zhou, Y. X. Zhu, Yanhong Xu, Yanping Huang, Yaohui Li, Yi Zheng, Yuchen Zhu, Yunxian Ma, Ying Tang, Yukun Zha, Yuting Yan, Z. Z. Ren, Zehui Ren, Zhangli Sha, Zhe Fu, Zhean Xu, Zhenda Xie, Zhengyan Zhang, Zhewen Hao, Zhicheng Ma, Zhigang Yan, Zhiyu Wu, Zihui Gu, Zijia Zhu, Zijun Liu, Zilin Li, Ziwei Xie, Ziyang Song, Zizheng Pan, Zhen Huang, Zhipeng Xu, Zhongyu Zhang, Zhen Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DeepSeek-R1通过强化学习提升大语言模型的推理能力,无需人工标注数据,实现更复杂的推理任务表现。

Journal ref Nature volume 645, pages 633-638 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22732 2026-01-06 cs.LG cs.CL 79%

Reasoning Beyond Limits: Advances and Open Problems for LLMs

超越极限的推理:大型语言模型的进展与开放问题

Mohamed Amine Ferrag, Norbert Tihanyi, Merouane Debbah

机构 * United Arab Emirates University(阿拉伯联合酋长国大学) Technology Innovation Institute(技术创新研究所) Eötvös Loránd University(厄特沃什·洛朗大学) Khalifa University of Science(谢赫扎耶德科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了大型语言模型在推理能力上的最新进展,分析了多种模型的创新与性能提升,并指出了未来在多步骤推理、鲁棒性、提示平衡及工具整合等方面的研究挑战。

Comments The paper is published ICT Express Volume 11, Issue 6, December 2025, Pages 1054-1096

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23019 2026-01-06 cs.RO 78%

Stairway to Success: An Online Floor-Aware Zero-Shot Object-Goal Navigation Framework via LLM-Driven Coarse-to-Fine Exploration

通往成功的阶梯:一种通过LLM驱动的粗到细探索的在线楼层感知零样本物体-目标导航框架

Zeying Gong, Rong Li, Tianshuai Hu, Ronghe Qiu, Lingdong Kong, Lingfeng Zhang, Guoyang Zhao, Yiyi Ding, Junwei Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 本文提出ASCENT框架,通过LLM驱动的粗到细探索实现在线楼层感知零样本物体-目标导航,无需预建地图或重新训练,适用于多楼层环境。

Comments Accepted to IEEE Robotics and Automation Letters (RAL). Project Page at https://zeying-gong.github.io/projects/ascent

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01708 2026-01-06 cs.CL 77%

A Training-Free Large Reasoning Model-based Knowledge Tracing Framework for Unified Prediction and Prescription

基于大推理模型的无训练知识追踪框架:用于统一预测与处方

Unggi Lee, Joo Young Kim, Ran Ju, Minyoung Jung, Jeyeon Eo

机构 * Chosun University(全州大学) Neudive Inc(Neudive公司) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Thinking-KT框架,利用测试时缩放技术,使小型LLM在无需训练的情况下实现高效的知识追踪预测、个性化反馈和学习推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01341 2026-01-06 cs.CL 77%

Reasoning Over Recall: Evaluating the Efficacy of Generalist Architectures vs. Specialized Fine-Tunes in RAG-Based Mental Health Dialogue Systems

基于回忆的推理:评估基于RAG的心理健康对话系统中通用架构与专门微调的有效性

Md Abdullah Al Kafi, Raka Moni, Sumit Kumar Banshal

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过比较通用推理模型与领域特定微调模型,发现通用模型在同理心和上下文理解方面表现更优,表明强大的推理能力比专门训练更能提升心理健康对话系统的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01195 2026-01-06 cs.AI 77%

Reinforcement Learning Enhanced Multi-hop Reasoning for Temporal Knowledge Question Answering

强化学习增强的多跳推理用于时间知识问答

Wuzhenghong Wen, Chao Xue, Su Pan, Yuwei Sun, Minlong Peng

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出MRE框架,通过增强正向和反向推理,提升时间知识问答中多跳推理的准确性和鲁棒性。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12869 2026-01-06 cs.CE cs.CL 77%

ERA-IT: Aligning Semantic Models with Revealed Economic Preference for Real-Time and Explainable Patent Valuation

ERA-IT:通过揭示的经济偏好对齐语义模型以实现实时和可解释的专利估值

Yongmin Yoo, Seungwoo Kim, Jingjiang Liu

机构 * School of Computing(计算学院) Macquarie University(麦考瑞大学) School of Computer Science(计算机科学学院) University of Technology Sydney(悉尼技术大学) School of Management(管理学院) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL

AI总结 ERA-IT通过揭示的经济偏好对齐语义模型,实现实时且可解释的专利估值,提升预测准确性并增强决策透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06781 2026-01-06 cs.CR cs.AI cs.PL 77%

From Description to Score: Can LLMs Quantify Vulnerabilities?

从描述到评分:大语言模型能否量化漏洞?

Sima Jafarikhah, Daniel Thompson, Eva Deans, Hossein Siadati, Yi Liu

机构 * University of North Carolina Wilmington(北卡罗来纳大学 Wilmington 分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究探讨了大语言模型在自动化CVSS评分中的潜力,发现其在某些指标上表现优异,但存在分类错误问题,需改进漏洞描述以提升自动化评分的可靠性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00845 2026-01-06 cs.AI 77%

Enhancing Temporal Awareness in LLMs for Temporal Point Processes

增强大语言模型在时序点过程中的时间感知能力

Lili Chen, Wensheng Gan, Shuang Liang, Philip S. Yu

机构 * School of Computer Science and Technology, Tongji University, Shanghai 201804, China(计算机科学与技术学院,同济大学) College of Cyber Security, Jinan University, Guangzhou 510632, China(网络安全学院,暨南大学) Department of Computer Science, University of Illinois Chicago, Chicago, USA(计算机科学系,伊利诺伊大学芝加哥分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TPP-TAL通过增强LLMs的时间感知能力,改进了时序点过程中的时间似然估计和事件预测准确性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01490 2026-01-06 cs.CL cs.AI 73%

Distortion Instead of Hallucination: The Effect of Reasoning Under Strict Constraints

扭曲而非虚构:在严格约束下推理的影响

Junichiro Niimi

机构 * Meijo University(名古屋大学) RIKEN(日本研究机构) AIP(Advanced Institute for Propulsion)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 在严格约束下,推理模型通过扭曲事实来减少约束违反,但牺牲了输出的真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24617 2026-01-06 cs.LG cs.AI 73%

Dynamic Large Concept Models: Latent Reasoning in an Adaptive Semantic Space

动态大概念模型:在适应性语义空间中的潜在推理

Xingwei Qu, Shaowen Wang, Zihao Huang, Kai Hua, Fan Yin, Rui-Jie Zhu, Jundong Zhou, Qiyang Min, Zihao Wang, Yizhi Li, Tianyu Zhang, He Xing, Zheng Zhang, Yuxuan Song, Tianyu Zheng, Zhiyuan Zeng, Chenghua Lin, Ge Zhang, Wenhao Huang

机构 * University of Manchester(曼彻斯特大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 动态大概念模型通过层次压缩和压缩感知扩展定律,在适应性语义空间中提升推理效率,实现零样本基准上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15401 2026-01-06 cs.CL cs.AI 73%

Problem-Solving Logic Guided Curriculum In-Context Learning for LLMs Complex Reasoning

基于问题解决逻辑的课程化上下文学习用于LLM复杂推理

Xuetao Ma, Wenbin Jiang, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出基于问题解决逻辑的课程化上下文学习方法,通过分析问题解决逻辑选择和排序示例,提升LLM复杂推理能力。

Comments 19 pages, 6 figures, ACL 2025 findings, camera-ready version

Journal ref Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14934 2026-01-06 cs.CL cs.AI 73%

GRACE: Discriminator-Guided Chain-of-Thought Reasoning

GRACE: 基于判别器的链式推理

Muhammad Khalifa, Lajanugen Logeswaran, Moontae Lee, Honglak Lee, Lu Wang

机构 * University of Michigan(密歇根大学) LG AI Research(LG人工智能研究) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GRACE通过引入判别器引导链式推理,有效提升多步推理任务中答案的准确性和中间推理的正确性。

Comments Fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02170 2026-01-06 cs.AI 70%

Streaming Hallucination Detection in Long Chain-of-Thought Reasoning

流式长推理链中的幻觉检测

Haolang Lu, Minghui Pan, Ripeng Li, Guoshun Nan, Jialin Zhuang, Zijie Zhao, Zhongxiang Sun, Kun Wang, Yang Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) Southwest Jiaotong University(西南交通大学) Renmin University of China(中国人民大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出通过跟踪推理状态演变来检测长推理链中的幻觉,提供实时可解释的检测证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23506 2026-01-06 cs.AI cs.HC 70%

Emotion-Coherent Reasoning for Multimodal LLMs via Emotional Rationale Verifier

通过情感推理验证器实现多模态大语言模型的情感一致性推理

Hyeongseop Rha, Jeong Hun Yeo, Yeonju Kim, Yong Man Ro

机构 * Corresponding author(通讯作者)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出情感推理验证器和解释奖励,通过引导模型生成与目标情绪一致的推理,提升多模态大语言模型在情绪识别中的解释准确性与一致性。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01868 2026-01-06 cs.CL 70%

DermoGPT: Open Weights and Open Data for Morphology-Grounded Dermatological Reasoning MLLMs

DermoGPT: 开放权重和开放数据用于基于形态的皮肤病学推理大语言模型

Jinghan Ru, Siyuan Yan, Yuguo Yin, Yuexian Zou, Zongyuan Ge

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Faculty of Information Technology, Monash University(信息科技学院,莫纳什大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DermoGPT通过开放权重和数据提升皮肤病学推理的MLLM性能,实现与专家诊断流程的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00923 2026-01-06 cs.AI 70%

Context Collapse: In-Context Learning and Model Collapse

上下文崩溃:上下文学习与模型崩溃

Josef Ott

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究探讨了大型语言模型中上下文学习与模型崩溃现象,通过数学分析揭示了上下文长度与模型稳定性之间的关系。

Comments Master's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20578 2026-01-06 cs.CL 70%

Can LLMs Predict Their Own Failures? Self-Awareness via Internal Circuits

LLMs能否预测自身失败?通过内部电路实现自感知

Amirhosein Ghasemabadi, Di Niu

机构 * University of Alberta(阿尔伯塔大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Gnosis通过分析LLM内部状态实现自我验证,有效提升生成过程的准确性和校准性,无需外部监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24133 2026-01-06 physics.chem-ph physics.comp-ph physics.data-an 67%

Bridging Visual Intuition and Chemical Expertise: An Autonomous Analysis Framework for Nonadiabatic Dynamics Simulations via Mentor-Engineer-Student Collaboration

弥合视觉直觉与化学专业性:通过导师-工程师-学生协作的自主分析框架实现非绝热动力学模拟分析

Yifei Zhu, Jiahui Zhang, Binni Huang, Zhenggang Lan

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 VisU通过导师-工程师-学生协作框架,实现非绝热动力学模拟分析的自动化,减少人工依赖,提升机理发现的直观性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏