arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-07 至 2026-01-07 共收录 75 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2601.03194 2026-01-07 cs.CL 57%

X-MuTeST: A Multilingual Benchmark for Explainable Hate Speech Detection and A Novel LLM-consulted Explanation Framework

X-MuTeST:一个用于可解释仇恨言论检测的多语言基准及一种新颖的LLM咨询解释框架

Mohammad Zia Ur Rehman, Sai Kartheek Reddy Kasu, Shashivardhan Reddy Koppula, Sai Rithwik Reddy Chirra, Shwetank Shekhar Singh, Nagendra Kumar

机构 * Indian Institute of Technology Indore(印度理工学院Indore) Indian Institute of Information Technology Dharwad(印度信息科技学院Dharwad) Arizona State University(亚利桑那州立大学) Indian Institute of Technology Mandi(印度理工学院Mandi)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 X-MuTeST提出一种结合LLM和传统技术的多语言仇恨言论检测框架,通过人类注释的解释提升分类性能和可解释性。

Comments Accepted in the proceedings of AAAI 2026

Journal ref AAA 2026 (AISI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11078 2026-01-07 cs.AI 57%

Patient-Zero: Scaling Synthetic Patient Agents to Real-World Distributions without Real Patient Data

Patient-Zero: 通过无需真实患者数据实现对真实世界分布的合成患者代理扩展

Yunghwei Lai, Ziyue Wang, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能学院,清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院,清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Patient-Zero通过无需真实患者数据的合成方法,实现了对真实世界分布的高效模拟,提升了医疗数据质量和交互保真度,且在临床任务中表现出显著的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13271 2026-01-07 cs.CL 57%

Do You Get the Hint? Benchmarking LLMs on the Board Game Concept

你得到提示了吗?对大型语言模型的棋盘游戏概念基准测试

Ine Gevers, Walter Daelemans

机构 * CLiPS, University of Antwerp(CLiPS,安特卫普大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过棋盘游戏Concept测试LLMs的演绎推理能力,发现人类易解而LLMs表现不佳,尤其在低资源语言中更差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06472 2026-01-07 cs.CV cs.MM 50%

CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model

CalliReader:通过嵌入对齐的视觉-语言模型 contextualizing 中文书法

Yuxuan Luo, Jiaqi Tang, Chenyi Huang, Feiyang Hao, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 CalliReader通过字符级切片、视觉-文本对齐和嵌入指令微调,解决中文书法的上下文识别问题,实现比现有方法和专业书法家更高的准确性与更低的幻觉率。

Comments 11 pages

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 11 篇

2601.03052 2026-01-07 cs.CL 79%

Detecting Hallucinations in Retrieval-Augmented Generation via Semantic-level Internal Reasoning Graph

通过语义层面内部推理图检测检索增强生成中的忠实性幻觉

Jianpeng Hu, Yanzeng Li, Jialun Zhong, Wenfa Qi, Lei Zou

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学) Institute of Artificial Intelligence and Future Networks, Beijing Normal University(人工智能与未来网络研究院,北京师范大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出基于语义层面内部推理图的方法,用于检测检索增强生成中的忠实性幻觉,通过构建依赖关系图和动态阈值调整提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02968 2026-01-07 cs.AI 79%

Rationale-Grounded In-Context Learning for Time Series Reasoning with Multimodal Large Language Models

基于理由的上下文学习用于多模态大语言模型的时间序列推理

Qingxiang Liu, Zhiqing Cui, Xiaoliang Luo, Yuqian Wu, Zhuoyang Jiang, Huaiyu Wan, Sheng Sun, Lvchun Wang, Wei Yu, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) China Mobile (Jiangxi) Virtual Reality Technology Co., Ltd.(中国移动(江西)虚拟现实技术有限公司) School of Computer and Information Technology, Beijing Jiaotong University(北京交通大学计算机与信息学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出RationaleTS方法,通过基于理由的上下文学习提升多模态大语言模型在时间序列推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03073 2026-01-07 cs.CV 78%

Understanding Multi-Agent Reasoning with Large Language Models for Cartoon VQA

通过大型语言模型理解多智能体推理用于漫画视觉问答

Tong Wu, Thanet Markchom

机构 * University of Reading(阅读大学)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出多智能体LLM框架,用于解决漫画图像中视觉抽象和叙事上下文的VQA问题,通过三个智能体协作提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02771 2026-01-07 cs.CV 78%

AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs

AbductiveMLLM: 提升多模态大语言模型中的视觉归纳推理

Boyu Chang, Qi Wang, Xi Guo, Zhixiong Nan, Yazhou Yao, Tianfei Zhou

专题命中 其他推理 :reasoning(title,abstract)

AI总结 AbductiveMLLM通过结合REASONER和IMAGINER组件,提升多模态大语言模型在视觉归纳推理中的性能。

Comments Accepted by AAAI 2026 as Oral. Code:https://github.com/ChangPtR/AbdMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02983 2026-01-07 cs.SD cs.AI 70%

Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning

通过频率-时间强化学习实现可解释的多类型音频深度伪造检测

Yuankun Xie, Xiaoxuan Guo, Jiayi Zhou, Tao Wang, Jian Liu, Ruibo Fu, Xiaopeng Wang, Haonan Cheng, Long Ye

机构 * Communication University of China(中国通信大学) Machine Intelligence, Ant Group(蚂蚁集团机器智能部) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出FT-GRPO方法,通过频率-时间强化学习实现多类型音频深度伪造检测的可解释性与高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07723 2026-01-07 cs.AI cs.CL cs.LG 67%

Stable Preference Optimization: A Bilevel Approach to Catastrophic Preference Shift

稳定偏好优化:一种针对灾难性偏好转移的双层方法

Chengtao Jian, Kai Yang, Tianhao Gao, Wuguang Ni, Keying Yang, Bowen Xiao, Jiajun Liu, Ye Ouyang

机构 * Tongji University(同济大学) AsiaInfo Technologies(亚洲信息科技)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出稳定偏好优化框架,通过约束偏好学习在安全对齐区域,解决灾难性偏好转移问题,提升偏好学习方法的稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23966 2026-01-07 cs.CL cs.AI 62%

Efficient Context Scaling with LongCat ZigZag Attention

高效上下文扩展与LongCat ZigZag注意力

Chen Zhang, Yang Bai, Jiahuan Li, Anchun Gui, Keheng Wang, Feifan Liu, Guanyu Wu, Yuwei Jiang, Defei Bu, Li Wei, Haihang Jing, Hongyin Tang, Xin Chen, Xiangzhou Huang, Fengcun Li, Rongxiang Weng, Yulei Qian, Yifan Lu, Yerui Sun, Jingang Wang, Yuchen Xie, Xunliang Cai

机构 * Meituan, China(美团,中国)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LongCat ZigZag Attention通过稀疏化全注意力模型,提升长上下文处理效率,实现高效长期推理和代理能力。

Comments 10 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04398 2026-01-07 cs.LG cs.AI 62%

IPA: An Information-Reconstructive Input Projection Framework for Efficient Foundation Model Adaptation

IPA: 一种信息重构的输入投影框架,用于高效的基础模型适应

Yuan Yin, Shashanka Venkataramanan, Tuan-Hung Vu, Andrei Bursuc, Matthieu Cord

机构 * Sorbonne Université(索邦大学) CNRS(国家科学研究中心) ISIR(信息科学研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 IPA通过信息重构的输入投影框架提升基础模型适应效率,实现更高准确率与更少参数消耗。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03204 2026-01-07 cs.AI cs.MA 57%

InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous Agents

InfiAgent: 通用自主代理的无限时间 horizon 框架

Chenglin Yu, Yuchen Wang, Songmiao Wang, Hongxia Yang, Ming Li

机构 * The University of Hong Kong(香港大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 InfiAgent 通过外部化持久状态实现无限时间 horizon 任务的稳定推理,无需任务特定微调即可在长时间任务中超越传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01491 2026-01-07 cs.CL 57%

The Homogenizing Effect of Large Language Models on Human Expression and Thought

大语言模型对人类表达与思维的同质化效应

Zhivar Sourati, Alireza S. Ziabari, Morteza Dehghani

机构 * Department of Computer Science(计算机科学系) Center for Computational Language Sciences(计算语言学中心) Department of Psychology, University of Southern California(心理学系,南加州大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 大语言模型通过标准化语言和推理,加剧了人类认知多样性的同质化效应,影响集体智慧和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01791 2026-01-07 eess.SP cs.IT cs.NI math.IT 50%

Rethinking Secure Semantic Communications in the Age of Generative and Agentic AI: Threats and Opportunities

在生成式和代理式AI时代重新思考安全语义通信:威胁与机遇

Shunpu Tang, Yuanyuan Jia, Zijiu Yang, Qianqian Yang, Ruichen Zhang, Jun Du, Jihong Park, Zhiguo Shi, Jiming Chen

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨了生成式和代理式AI时代语义通信的安全与隐私挑战,分析了生成式AI和代理式AI对窃听威胁的影响,并提出设计隐私保护语义通信系统的机会。

详情

展开后加载摘要…

URL PDF HTML 收藏