arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-19 至 2025-12-19 共收录 61 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2512.15959 2025-12-19 cs.CL cs.AI 81%

BRAID: Bounded Reasoning for Autonomous Inference and Decisions

BRAID:自主推理与决策的有界推理

Armağan Amcalar, Eyup Cinar

机构 * OpenServ Labs(OpenServ实验室) Computer Engineering Department(计算机工程系) Eskisehir Osmangazi University(埃斯基谢普大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 BRAID通过结构化提示提升自主代理推理效率和成本效益

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16676 2025-12-19 cs.LG cs.CL 73%

DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI

DataFlow:面向数据导向AI时代的统一数据准备与工作流自动化框架

Hao Liang, Xiaochen Ma, Zhou Liu, Zhen Hao Wong, Zhengyang Zhao, Zimo Meng, Runming He, Chengyu Shen, Qifeng Cai, Zhaoyang Han, Meiyi Qiang, Yalin Feng, Tianyi Bai, Zewei Pan, Ziyi Guo, Yizhen Jiang, Jingwen Deng, Qijie You, Peichao Lai, Tianyu Guo, Chi Hsu Tsai, Hengyi Feng, Rui Hu, Wenkai Yu, Junbo Niu, Bohan Zeng, Ruichuan An, Lu Ma, Jihao Huang, Yaowei Zheng, Conghui He, Linpeng Tang, Bin Cui, Weinan E, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究所) OriginHub Technology(OriginHub技术) OpenDataLab(OpenData实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) LLaMA-Factory Team(LLaMA-Factory团队)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 DataFlow通过统一的数据准备框架和自动化工作流,提升LLM性能,实现高效、可靠的数据处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16649 2025-12-19 cs.CL 57%

JustRL: Scaling a 1.5B LLM with a Simple RL Recipe

JustRL: 通过简单强化学习方法扩展1.5B语言模型

Bingxiang He, Zekai Qu, Zeyuan Liu, Yinghao Chen, Yuxin Zuo, Cheng Qian, Kaiyan Zhang, Weize Chen, Chaojun Xiao, Ganqu Cui, Ning Ding, Zhiyuan Liu

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai AI Lab(上海人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 JustRL通过简单强化学习方法在1.5B语言模型上实现高性能,省去复杂训练流程,展现稳定训练效果。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2511.07420 2025-12-19 math.HO cs.AI cs.HC math.GR math.LO 70%

Advancing mathematics research with generative AI

用生成式人工智能推动数学研究

Lisa Carbone

机构 * Department of Mathematics, Rutgers University(数学系,罗格斯大学)

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文探讨了生成式人工智能在数学研究中的应用,包括其作为交互式助手的功能以及与神经符号求解器等工具的整合。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 3 篇

2512.15751 2025-12-19 cs.LG cs.AI cs.MA 81%

GLOW: Graph-Language Co-Reasoning for Agentic Workflow Performance Prediction

GLOW:基于图-语言协同推理的代理工作流性能预测

Wei Guan, Jian Cao, Jinyu Cai, Qiqi Cai, Jianqi Gao, See-Kiong Ng

机构 * School of Computer Science, Shanghai Jiao Tong University, China(上海交通大学计算机科学学院) Institute of Data Science, National University of Singapore, Singapore(新加坡国立大学数据科学研究所) School of Computer Engineering and Science, Shanghai University, China(上海大学计算机工程与科学学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 GLOW通过结合图神经网络与大语言模型,提出了一种统一的代理工作流性能预测框架,有效捕捉拓扑依赖和语义逻辑,提升预测准确性与排序效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15816 2025-12-19 cs.PL cs.AI cs.LO 79%

A Neurosymbolic Approach to Loop Invariant Generation via Weakest Precondition Reasoning

通过最弱前条件推理的神经符号方法生成循环不变式

Daragh King, Vasileios Koutavas, Laura Kovacs

机构 * Trinity College Dublin(都柏林三一学院) Lero, Research Ireland Centre for Software(爱尔兰软件研究中心) Faculty of Informatics, TU Wien(信息学院,维也纳技术大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 NeuroInv通过结合神经推理和符号验证方法,高效生成循环不变式,成功率达到99.5%,在复杂验证场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20978 2025-12-19 cs.AI cs.LO cs.SC 57%

Scaling Neuro-symbolic Problem Solving: Solver-Free Learning of Constraints and Objectives

规模化神经符号问题求解:无求解器学习约束与目标

Marianne Defresne, Romain Gambardella, Sophie Barbe, Thomas Schiex

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种可微神经符号架构和损失函数,用于高效学习解决NP难推理问题,通过概率损失同时学习约束和目标,实现可扩展训练和高精度推断。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 10 篇

2512.16424 2025-12-19 cs.AI 83%

Synthelite: Chemist-aligned and feasibility-aware synthesis planning with LLMs

Synthelite: 基于LLM的化学家对齐且可行性感知的合成规划

Nguyen Xuan-Vu, Daniel Armstrong, Milena Wehrbach, Andres M Bran, Zlatko Jončev, Philippe Schwaller

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校) National Centre of Competence in Research (NCCR) Catalysis(瑞士国家催化研究中心) B12 Labs(B12实验室)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 Synthelite 基于LLM实现化学家对齐且可行性感知的合成规划,通过自然语言提示允许专家干预,成功率达95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15756 2025-12-19 cs.LG cs.AI 76%

ReactorFold: Generative discovery of nuclear reactor cores via emergent physical reasoning

ReactorFold:通过涌现物理推理生成核反应堆核心

Yoonpyo Lee

专题命中 规划推理 :reasoning(title);分类 cs.AI、cs.LG

AI总结 ReactorFold通过生成框架和涌现物理推理,实现了核反应堆核心设计的创新发现,突破传统设计限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01869 2025-12-19 cs.RO cs.AI cs.MA 70%

TACOS: Task Agnostic COordinator of a multi-drone System

TACOS:多无人机系统的任务无关协调器

Alessandro Nazzari, Roberto Rubinacci, Marco Lovera

机构 * Dipartimento di Scienze e Tecnologie Aerospaziali, Politecnico di Milano(航空航天科学与技术系,米兰理工学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 TACOS通过大型语言模型实现多无人机系统的高层自然语言控制,整合自然语言接口、智能协调器和自主代理,实现灵活的任务分配与实时协调。

Comments 8 pages, 9 figures, submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16532 2025-12-19 cs.AI cs.IR 57%

From Personalization to Prejudice: Bias and Discrimination in Memory-Enhanced AI Agents for Recruitment

从个性化到偏见:记忆增强型AI招聘代理中的偏见与歧视

Himanshu Gharat, Himanshi Agrawal, Gourab K. Patro

机构 * Phi Labs, Quantiphi Inc.(Phi实验室、Quantiphi公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究揭示了记忆增强型AI招聘代理中偏见的系统性引入与强化,强调了对LLM基础AI代理的额外防护措施的必要性。

Comments In Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining (WSDM '26)

Journal ref In Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining (WSDM '26), 2026, Boise, ID, USA. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08226 2025-12-19 cs.LG 57%

UAMDP: Uncertainty-Aware Markov Decision Process for Risk-Constrained Reinforcement Learning from Probabilistic Forecasts

UAMDP:面向风险约束强化学习的概率预测不确定性感知马尔可夫决策过程

Michal Koren, Or Peretz, Tai Dinh, Philip S. Yu

机构 * The Kyoto College of Graduate Studies for Informatics(京都大学研究生院信息学研究科) Department of Computer Science, University of Illinois at Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 UAMDP通过整合概率预测、后验不确定性探索和风险约束规划,提升高波动环境下序列决策的安全性和盈利能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13324 2025-12-19 cs.AI cs.MA 57%

Towards Pervasive Distributed Agentic Generative AI -- A State of The Art

迈向普及型分布式代理生成AI——综述

Gianni Molinari, Fabio Ciravegna

机构 * University of Turin(都灵大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文综述了智能代理和大语言模型在普及计算中的最新发展,探讨了代理部署策略、挑战及提出的‘代理作为工具’框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16149 2025-12-19 cs.AI 57%

ToolForge: A Data Synthesis Pipeline for Multi-Hop Search without Real-World APIs

ToolForge: 一种无需真实世界API的多跳搜索数据合成管道

Hao Chen, Zhexin Hu, Jiajun Chai, Haocheng Yang, Hang He, Xiaohan Wang, Wei Lin, Luhang Wang, Guojun Yin, Zhuofeng zhao

机构 * North China University of Technology(华北理工大学) Meituan(美团) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National University of Singapore(新加坡国立大学) East China Normal University(华东师范大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 ToolForge通过构建虚拟工具生成多跳搜索数据,无需真实API调用,提升模型在多跳推理任务中的性能。

Comments 13 pages, 9 tables, 6 figures. Code available at https://github.com/Buycar-arb/ToolForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15834 2025-12-19 cs.PL cs.AI cs.DC cs.PF cs.SE 57%

Optimizing Agentic Language Model Inference via Speculative Tool Calls

通过推测性工具调用优化代理语言模型推理

Daniel Nichols, Prajwal Singhania, Charles Jekel, Abhinav Bhatele, Harshitha Menon

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过推测性工具调用优化代理语言模型推理,提升推理吞吐量并提供理论分析与工具缓存API。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16514 2025-12-19 cs.GT 50%

Algorithmic Monetary Policies for Blockchain Participation Games

区块链参与博弈中的算法货币政策

Diodato Ferraioli, Paolo Penna, Manvir Schneider, Carmine Ventre

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种算法货币政策框架,用于在区块链参与博弈中平衡短期性能激励与长期去中心化目标,通过分析不同参与者行为下的均衡,探讨了虚拟质押对长期影响的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09525 2025-12-19 cs.CV 50%

Masked Registration and Autoencoding of CT Images for Predictive Tibia Reconstruction

遮蔽注册与CT图像自编码用于预测胫骨重建

Hongyou Zhou, Cederic Aßmann, Alaa Bejaoui, Heiko Tzschätzsch, Mark Heyland, Julian Zierke, Niklas Tuttle, Sebastian Hölzl, Timo Auer, David A. Back, Marc Toussaint

机构 * Technical University Berlin(技术大学柏林) Charité – Universitätsmedizin Berlin(柏林查理医院) Freie Universität Berlin(自由大学柏林) Humboldt-Universität zu Berlin(洪堡大学柏林) Institute of Medical Informatics(医学信息学研究所) Center for Musculoskeletal Surgery(骨科手术中心) Julius Wolff Institute(朱利叶斯·沃尔夫研究所)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种结合神经注册和自编码器的方法,用于从骨折胫骨CT图像预测患者特异性健康骨结构。

Comments DGM4MICCAI

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 11 篇

2512.16561 2025-12-19 cs.CV 85%

N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models

N3D-VLM:原生3D接地使视觉-语言模型在3D场景中实现精确的空间推理

Yuxin Wang, Lei Ke, Boqiang Zhang, Tianyuan Qu, Hanxun Yu, Zhenpeng Huang, Meng Yu, Dan Xu, Dong Yu

机构 * HKUST(香港科技大学) Tencent AI Lab(腾讯AI实验室) CUHK(香港中文大学) ZJU(浙江大学) NJU(南京大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 N3D-VLM通过原生3D感知能力提升视觉-语言模型在3D场景中的空间推理精度与解释性。

Comments Project Page: https://n3d-vlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16698 2025-12-19 cs.AI cs.CG 79%

Do Multi-Agents Solve Better Than Single? Evaluating Agentic Frameworks for Diagram-Grounded Geometry Problem Solving and Reasoning

多智能体表现更优吗?评估用于图示引导几何问题解决与推理的智能体框架

Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Mohammad Nehad Alam, Proma Hossain Progga, Swakkhar Shatabda

机构 * BRAC University(布拉克大学) United International University(国际联合大学) Center for Computational & Data Sciences(计算与数据科学中心) Independent University, Bangladesh(孟加拉国独立大学) Spectrum Software & Consulting Ltd(Spectrum软件与咨询有限公司)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文评估了多智能体框架在图示引导几何问题解决中的表现,发现其对开源模型有明显提升,但对闭源模型效果有限,且并非普遍最优。

Comments Accepted to the ARR October 2025 cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16237 2025-12-19 cs.AI 79%

Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis

通过程序化数据合成提升大规模语言模型的空间推理能力

Zhi Helu, Huang Jingjing, Xu Wang, Xu Yangbin, Zhang Wanyue, Jiang Baoyang, Deng Shirui, Zhu Liang, Li Fangfang, Zhao Tiejun, Lin Yankai, Yao Yuan

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua University(清华大学) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院电子学研究所) Renmin University of China(中国人民大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Central South University(中南大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SPRITE通过程序化数据合成生成高质量空间推理数据,提升大规模语言模型的空间推理能力,并在多个基准测试中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15705 2025-12-19 cs.CV 78%

GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization

GeoVista: 基于网络增强的代理视觉推理用于地理定位

Yikun Wang, Zuyan Liu, Ziyi Wang, Han Hu, Pengfei Liu, Yongming Rao

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯文元) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 GeoVista通过整合图像缩放和网络搜索工具,提升地理定位任务的代理模型性能,实现优于开源模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16461 2025-12-19 cs.CV cs.RO 78%

SNOW: Spatio-Temporal Scene Understanding with World Knowledge for Open-World Embodied Reasoning

SNOW:基于世界知识的时空场景理解用于开放世界具身推理

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃斯林根应用科学大学) Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业联合会) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SNOW通过整合视觉语言模型与点云几何,实现统一的4D场景理解,提升开放世界具身推理的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15940 2025-12-19 cs.CV cs.RO 78%

R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space

R4:在4D时空空间中为视觉语言模型引入检索增强推理

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃斯林根应用科学大学) Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业协会) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 R4通过构建4D时空知识库,使视觉语言模型具备结构化终身记忆,实现无需训练的检索增强推理,提升动态环境中的具身推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16891 2025-12-19 cs.CV cs.AI cs.IR cs.LG cs.MM 62%

LinkedOut: Linking World Knowledge Representation Out of Video LLM for Next-Generation Video Recommendation

LinkedOut: 从视频大语言模型中提取世界知识表示以实现下一代视频推荐

Haichao Zhang, Yao Lu, Lichen Wang, Yunzhe Li, Daiwei Chen, Yunpeng Xu, Yun Fu

机构 * Northeastern University(东北大学) LinkedIn(领英) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LinkedOut通过从视频中提取世界知识表示,实现低延迟、多视频输入的视频推荐,无需人工标注,取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15885 2025-12-19 cs.CV cs.AI cs.CL cs.MM 62%

Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models

超越文字:面向多模态大语言模型的自监督视觉学习

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Pier Luigi Dovesi, Shaghayegh Roohi, Mark Granroth-Wilding, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) AMD Silo AI

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 JARVIS通过自监督视觉学习提升多模态大语言模型的视觉推理能力,无需依赖语言监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16755 2025-12-19 cs.AI 57%

CitySeeker: How Do VLMS Explore Embodied Urban Navigation With Implicit Human Needs?

CitySeeker: VLMS如何通过隐含人类需求探索具身城市导航

Siqi Wang, Chao Liang, Yunfan Gao, Erxin Yu, Sen Li, Yushi Li, Jing Li, Haofen Wang

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Tongji University(同济大学) Nanjing Institute of Geography and Limnology, Chinese Academy of Sciences(中国科学院南京地理与湖泊研究所) Research Centre for Data Science & Artificial Intelligence(数据科学与人工智能研究中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 CitySeeker通过评估VLMs在动态城市环境中探索具身导航的能力,揭示了隐含需求理解中的关键瓶颈,并提出改进策略以提升空间推理和决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16245 2025-12-19 cs.AI 57%

AlignMerge - Alignment-Preserving Large Language Model Merging via Fisher-Guided Geometric Constraints

AlignMerge - 通过Fisher引导的几何约束实现的保持对齐的大语言模型合并

Aniruddha Roy, Jyoti Patel, Aman Chadha, Vinija Jain, Amitava Das

机构 * AI Institute, University of South Carolina(AI研究院,南卡罗来纳大学) Indian Institute of Technology, Kharagpur(印度理工学院,Khargpur分校) Islamic University of Technology(伊斯兰科技大学) Stanford University, USA(斯坦福大学,美国) Amazon AI, USA(亚马逊AI,美国) HCL(HCL公司) Evalueserve(Evalueserve公司) Apple (USA)(苹果(美国)) Google (USA)(谷歌(美国)) Pragya Lab, BITS Pilani, Goa(Pragya实验室, BITS Pilani,Goa分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 AlignMerge通过Fisher引导的几何约束实现大语言模型合并,提升对齐度量并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16724 2025-12-19 cs.RO cs.CV 50%

VERM: Leveraging Foundation Models to Create a Virtual Eye for Efficient 3D Robotic Manipulation

VERM:利用基础模型创建虚拟眼睛以实现高效的3D机器人操作

Yixiang Chen, Yan Huang, Keji He, Peiyan Li, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新技术实验室,多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges Shandong University(山东大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 VERM通过利用基础模型创建虚拟视图,提升3D机器人操作的效率和准确性,实现训练和推理速度的显著提升。

Comments Accepted at RA-L 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 2 篇

2512.16304 2025-12-19 cs.SD 82%

CogSR: Semantic-Aware Speech Super-Resolution via Chain-of-Thought Guided Flow Matching

CogSR: 通过思维链引导的流匹配实现语义感知的语音超分辨率

Jiajun Yuan, Xiaochen Wang, Yuhang Xiao, Yulin Wu, Chenhao Hu, Xueyang Lv

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University, Wuhan, China(多媒体软件国家工程研究中心、计算机科学学院、武汉大学、武汉) School of Artificial Intelligence, Jianghan University, Wuhan, China(人工智能学院、江汉大学、武汉) Xiaomi Corporation, Beijing, China(小米公司、北京)

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract)

AI总结 CogSR通过整合大型音频-语言模型和思维链推理,实现语义感知的语音超分辨率,提升低采样率录音的修复精度和语言准确性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02262 2025-12-19 cs.CV 50%

From Frames to Clips: Training-free Adaptive Key Clip Selection for Long-Form Video Understanding

从帧到片段:训练免费的自适应关键片段选择用于长形式视频理解

Guangyu Sun, Archit Singhal, Burak Uzkent, Mubarak Shah, Chen Chen, Garin Kessler

机构 * Amazon(亚马逊公司) University of Central Florida(中央佛罗里达大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 F2C通过自适应关键片段选择提升长视频理解,比均匀采样在多个基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏