arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-11 至 2025-12-11 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 11 篇

2512.09616 2025-12-11 cs.CV cs.AI cs.CL cs.LG 90%

Rethinking Chain-of-Thought Reasoning for Videos

重新思考视频中的链式推理

Yiwu Zhong, Zi-Yuan Hu, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出了一种高效的视频推理框架,通过简洁推理和减少的视觉标记提升推理效率和性能,无需依赖传统CoT注释或监督微调。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09396 2025-12-11 cs.MA cs.AI 79%

GAIR: GUI Automation via Information-Joint Reasoning and Group Reflection

GAIR:通过信息联合推理和群体反思实现GUI自动化

Zishu Wei, Qixiang Ma, Xavier Hu, Yuhang Liu, Hui Zang, Yudong Zhao, Tao Wang, Shengyu Zhang, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 GAIR是一种基于MLLM的GUI自动化代理框架,通过信息联合推理和群体反思整合异质模型能力,提升GUI自动化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14256 2025-12-11 cs.AI cs.IR 79%

PathMind: A Retrieve-Prioritize-Reason Framework for Knowledge Graph Reasoning with Large Language Models

PathMind: 一种基于大语言模型的知识图谱推理检索-优先-推理框架

Yu Liu, Xixun Lin, Yanmin Shang, Yangxi Li, Shi Wang, Yanan Cao

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 PathMind通过检索-优先-推理框架,提升大语言模型在知识图谱推理中的准确性和可解释性,尤其在复杂推理任务中表现优异。

Comments AAAI 2026, Long Paper, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09354 2025-12-11 cs.CV 78%

Video-QTR: Query-Driven Temporal Reasoning Framework for Lightweight Video Understanding

Video-QTR: 一种基于查询的轻量级视频理解时序推理框架

Xinkui Zhao, Zuxin Wang, Yifan Zhang, Guanjie Cheng, Yueshen Xu, Shuiguang Deng, Chang Liu, Naibo Wang, Jianwei Yin

机构 * School of Software Technology, Zhejiang University, Hangzhou, China(浙江大学软件技术学院) School of Computer Science, Zhejiang University, Hangzhou, China(浙江大学计算机科学学院) School of Software Engineering, Xidian University, Xi’an, China(西安电子科技大学软件工程学院)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 Video-QTR通过查询驱动的时序推理框架,实现轻量级视频理解,显著降低计算成本并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09081 2025-12-11 cs.CV 78%

AgentComp: From Agentic Reasoning to Compositional Mastery in Text-to-Image Models

AgentComp: 从代理推理到文本-图像模型中的组合性 mastery

Arman Zarei, Jiacheng Pan, Matthew Gwilliam, Soheil Feizi, Zhenheng Yang

机构 * TikTok University of Maryland(马里兰大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 AgentComp通过训练模型区分组合性相似的提示和图像,提升文本-图像模型的组合性生成能力,实现更准确的图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07564 2025-12-11 cs.CV cs.AI cs.CL cs.LG 69%

Toward More Reliable Artificial Intelligence: Reducing Hallucinations in Vision-Language Models

迈向更可靠的人工智能:减少视觉-语言模型中的幻觉

Kassoum Sanogo, Renzo Ardiccioni

机构 * Department of CS AI and Data Science(计算机科学与数据科学系) ESEO Engineering School(ESEO工程学院) Faculty of Law, Economy, Management(法学院、经济与管理学院)

专题命中 复杂问题求解 :self-correction(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出无需训练的自我纠正框架,通过不确定性引导的视觉再注意力减少视觉-语言模型中的幻觉,提升响应准确性。

Comments 24 pages, 3 figures, 2 tables. Training-free self-correction framework for vision-language models. Code and implementation details will be released at: https://github.com/kassoumsanogo1/self-correcting-vlm-re-Attention.git

Journal ref The 4th National and International Academic Conference Celebrating the 20th Anniversary of Rajapruk University (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09487 2025-12-11 cs.CL cs.AI cs.IR 62%

RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement Learning

RouteRAG: 通过强化学习实现文本和图的高效检索增强生成

Yucan Guo, Miao Su, Saiping Guan, Zihao Sun, Xiaolong Jin, Jiafeng Guo, Xueqi Cheng

机构 * CAS Key Laboratory of Network Data Science and Technology, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所网络数据科学与技术重点实验室) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RouteRAG通过强化学习实现文本和图的高效混合检索增强生成,提升多轮推理和复杂任务的适应性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09199 2025-12-11 cs.LG cs.AI cs.PF 62%

LLMs for Analog Circuit Design Continuum (ACDC)

用于模拟电路设计连续体的大型语言模型(ACDC)

Yasaman Esfandiari, Jocelyn Rego, Austin Meyer, Jonathan Gallagher, Mia Levy

机构 * HRL Laboratories(HRL实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大型语言模型在模拟电路设计中的适用性与一致性,探讨了不同数据表示对模型行为的影响,并揭示了LLMs在工程任务中的可靠性挑战与潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08944 2025-12-11 cs.CL 57%

Enhancing Reliability across Short and Long-Form QA via Reinforcement Learning

通过强化学习提升短篇和长篇问答的可靠性

Yudong Wang, Zhe Yang, Wenhan Ma, Zhifang Sui, Liang Zhao

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过强化学习框架减少短篇和长篇问答中的幻觉问题,提升模型可靠性与事实可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08939 2025-12-11 cs.HC cs.AI cs.CY 57%

Assessing the Human-Likeness of LLM-Driven Digital Twins in Simulating Health Care System Trust

评估由大语言模型驱动的数字双胞胎在模拟医疗系统信任方面的类人程度

Yuzhou Wu, Mingyang Wu, Di Liu, Rong Yin, Kang Li

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究评估了由大语言模型驱动的数字双胞胎在模拟医疗系统信任方面的类人程度,发现其在主要人口统计学模式上表现良好,但对教育水平等细微差异的捕捉能力有限。

Comments 6 pages, 1 figure may be published in IISE Annual Conference & Expo 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20427 2025-12-11 cs.CV 50%

Seedream 4.0: Toward Next-generation Multimodal Image Generation

Seedream 4.0:迈向下一代多模态图像生成

Team Seedream, :, Yunpeng Chen, Yu Gao, Lixue Gong, Meng Guo, Qiushan Guo, Zhiyao Guo, Xiaoxia Hou, Weilin Huang, Yixuan Huang, Xiaowen Jian, Huafeng Kuang, Zhichao Lai, Fanshi Li, Liang Li, Xiaochen Lian, Chao Liao, Liyang Liu, Wei Liu, Yanzuo Lu, Zhengxiong Luo, Tongtong Ou, Guang Shi, Yichun Shi, Shiqi Sun, Yu Tian, Zhi Tian, Peng Wang, Rui Wang, Xun Wang, Ye Wang, Guofeng Wu, Jie Wu, Wenxu Wu, Yonghui Wu, Xin Xia, Xuefeng Xiao, Shuang Xu, Xin Yan, Ceyuan Yang, Jianchao Yang, Zhonghua Zhai, Chenlin Zhang, Heng Zhang, Qi Zhang, Xinyu Zhang, Yuwei Zhang, Shijia Zhao, Wenliang Zhao, Wenjia Zhu

机构 * ByteDance(字节跳动)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 Seedream 4.0通过高效多模态框架实现文本到图像生成、图像编辑和多图像组合,展示卓越的多模态能力与高效推理性能。

Comments Seedream 4.0/4.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏