arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-24 至 2025-12-24 共收录 41 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 11 篇

2512.20184 2025-12-24 cs.DC 78%

Reaching Agreement Among Reasoning LLM Agents

使推理LLM代理达成一致

Chaoyi Ruan, Yiliang Wang, Ziji Shi, Jialin Li

专题命中 推理评测 :reasoning(title,abstract)

AI总结 Aegean通过引入基于共识的协议,为多代理推理提供正式模型,有效减少延迟并保持答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15649 2025-12-24 cs.CV cs.AI cs.CL 62%

VTCBench: Can Vision-Language Models Understand Long Context with Vision-Text Compression?

VTCBench: 视觉-语言模型能否通过视觉-文本压缩理解长上下文?

Hongbo Zhao, Meng Wang, Fei Zhu, Wenzhuo Liu, Bolin Ni, Fanhu Zeng, Gaofeng Meng, Zhaoxiang Zhang

机构 * 1 Institute of Automation, Chinese Academy of Sciences 2 School of Artificial Intelligence, University of Chinese Academy of Sciences 3 Centre for Artificial Intelligence Robotics, Hong Kong Institute of Science \& Innovation, CAS 4 Independent Researcher

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 VTCBench评估视觉-文本压缩对视觉语言模型长上下文理解能力的影响,发现多数模型在处理压缩信息时表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19992 2025-12-24 cs.AI cs.CY 57%

S$^3$IT: A Benchmark for Spatially Situated Social Intelligence Test

S$^3$IT:一种用于空间情境社交智能测试的基准

Zhe Sun, Xueyuan Yang, Yujie Lu, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 S$^3$IT基准通过座位安排任务评估代理在现实情境中整合物理与社会约束的能力,揭示LLMs在空间智能上的不足及在冲突解决中的潜力。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20013 2025-12-24 cs.CV 50%

SegEarth-R2: Towards Comprehensive Language-guided Segmentation for Remote Sensing Images

SegEarth-R2: 向远程 sensing 图像的全面语言引导分割迈进

Zepeng Xin, Kaiyu Li, Luodi Chen, Wanchen Li, Yuchen Xiao, Hui Qiao, Weizhan Zhang, Deyu Meng, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) China Telecom Shaanxi Branch(中国电信陕西分支)

专题命中 推理评测 :reasoning(abstract)

AI总结 SegEarth-R2通过MLLM架构实现远程 sensing 图像的全面语言引导分割,解决复杂场景下的多目标和隐含意图识别问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19990 2025-12-24 cs.CV 50%

A Dual-Branch Local-Global Framework for Cross-Resolution Land Cover Mapping

面向跨分辨率土地覆盖制图的双分支局部-全局框架

Peng Gao, Ke Li, Di Wang, Yongshan Zhu, Yiming Zhang, Xuemei Luo, Yifeng Wang

机构 * Guangzhou Institute of Technology(广州科技研究院) Xidian University(西安电子科技大学) School of Computer Science and Technology(计算机科学与技术学院) University of California(加州大学) Department of Mathematics(数学系)

专题命中 推理评测 :reasoning(abstract)

AI总结 DDTM通过双分支框架解耦局部语义细化与全局上下文推理,提升跨分辨率土地覆盖制图的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12711 2025-12-24 cs.CV 50%

Drifting Away from Truth: GenAI-Driven News Diversity Challenges LVLM-Based Misinformation Detection

远离真相:生成式AI驱动的新闻多样性对基于LVLM的虚假信息检测的挑战

Fanxiao Li, Jiaying Wu, Tingchao Fu, Yunyun Dong, Bingbing Song, Wei Zhou

专题命中 推理评测 :reasoning(abstract)

AI总结 本文探讨生成式AI驱动的新闻多样性对基于LVLM的虚假信息检测系统造成的挑战,通过DriftBench基准揭示了现有系统在多级漂移下的鲁棒性问题,并指出需要更稳健的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 5 篇

2505.24347 2025-12-24 cs.CL eess.AS 70%

Fewer Hallucinations, More Verification: A Three-Stage LLM-Based Framework for ASR Error Correction

更少的幻觉,更多的验证:一种基于LLM的三阶段框架用于语音识别错误纠正

Yangui Fang, Baixu Chen, Jing Peng, Xu Li, Yu Xi, Chengwei Zhang, Guohui Zhong

机构 * Huazhong University of Science and Technology, School of Electronic Information and Communications(华中科技大学电子信息与通信学院) MoE Key Lab of Artificial Intelligence, AI Institute, X-LANCE Lab, Shanghai Jiao Tong University, Shanghai, China(人工智能联合实验室、AI研究院、X-LANCE实验室、上海交通大学) AISpeech Ltd, Suzhou, China(上海苏州AISpeech有限公司)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出一种基于LLM的三阶段框架,用于减少语音识别错误纠正中的幻觉问题,通过预检测、链式思维修正和推理验证提高纠正准确性。

Comments This paper has been ACCEPTED for publication in ASRU

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20417 2025-12-24 cs.CV cs.MA 67%

Chain-of-Anomaly Thoughts with Large Vision-Language Models

基于大视觉-语言模型的异常思维链

Pedro Domingos, João Pereira, Vasco Lopes, João Neves, David Semedo

机构 * NOVALINCS, NOVA School of Science and Technology(NOVALINCS、NOVA科学与技术学院) NOVALINCS, Universidade da Beira Interior(NOVALINCS、贝拉内尔大学) DeepNeuronic

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出CoAT框架,通过引入异常偏见提升大视觉-语言模型在异常检测和分类任务中的性能。

Comments 2 pages, 3 figures, 1 table. Accepted for RECPAD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20333 2025-12-24 cs.AI q-bio.QM 57%

SynCraft: Guiding Large Language Models to Predict Edit Sequences for Molecular Synthesizability Optimization

SynCraft: 引导大语言模型预测编辑序列以优化分子合成可行性

Junren Li, Luhua Lai

机构 * BNLMS, College of Chemistry and Molecular Engineering, Peking University, Beijing 100871, China(BNLMS,化学与分子工程学院,北京大学,北京100871,中国)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 SynCraft通过引导大语言模型预测编辑序列,优化分子合成可行性,提升生成分子的结构保真度和合成可行性。

Comments 28 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19742 2025-12-24 cs.LG 57%

On-device Large Multi-modal Agent for Human Activity Recognition

用于人体活动识别的设备端大多模态智能体

Md Shakhrul Iman Siam, Ishtiaque Ahmed Showmik, Guanqun Song, Ting Zhu

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种用于人体活动识别的设备端大多模态智能体,结合大语言模型提升性能与可解释性,实现高分类准确率和用户友好交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01801 2025-12-24 cs.RO cs.LG 57%

GR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation

GR-RL:为长周期机械操作实现灵活与精确

Yunfei Li, Xiao Ma, Jiafeng Xu, Yu Cui, Zhongren Cui, Zhigang Han, Liqun Huang, Tao Kong, Yuxiao Liu, Hao Niu, Wanli Peng, Jingchao Qiao, Zeyu Ren, Haixin Shi, Zhi Su, Jiawen Tian, Yuyang Xiao, Shenyu Zhang, Liwei Zheng, Hang Li, Yonghui Wu

机构 * ByteDance(字节跳动)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 GR-RL通过多阶段训练管道,将通用VLA策略转化为擅长长周期精确操作的专家策略,成功实现自主系鞋带任务。

详情

展开后加载摘要…

URL PDF HTML 收藏