arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-17 至 2025-12-17 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 10 篇

2509.17116 2025-12-17 cs.AI 83%

MCTS-EP: Empowering Embodied Planning with Online Preference Optimization

MCTS-EP:通过在线偏好优化增强具身规划

Hang Xu, Zang Yu, Yehui Tang, Pengbo Hu, Yuhao Tang, Hao Dong

机构 * School of Management, Fudan University, Shanghai, China(复旦大学管理学院) Independent Researcher(独立研究者) CFCS, School of Computer Science, Peking University, Beijing, China(计算机科学系,北京大学) PKU-AgiBot Lab, Peking University, Beijing, China(北京大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 MCTS-EP通过结合大语言模型与蒙特卡洛树搜索,实现具身智能体的在线偏好优化,提升多模态任务的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14448 2025-12-17 cs.CR cs.AI 79%

Reasoning-Style Poisoning of LLM Agents via Stealthy Style Transfer: Process-Level Attacks and Runtime Monitoring in RSV Space

通过隐蔽的风格迁移进行LLM代理的推理风格污染:过程级攻击与运行时监控在RSV空间中

Xingfu Zhou, Pengfei Wang

机构 * college of computer science, National University of Defense Technology(计算机科学学院,国防科技大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出推理风格污染攻击,通过隐蔽方式改变LLM代理的推理风格,导致性能下降并绕过内容过滤,提出运行时监控方法应对该漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12791 2025-12-17 cs.MA cs.AI cs.SE 70%

Beyond Task Completion: An Assessment Framework for Evaluating Agentic AI Systems

超越任务完成:评估智能体AI系统的框架

Sreemaee Akshathala, Bassam Adnan, Mahisha Ramesh, Karthik Vaidhyanathan, Basil Muhammed, Kannan Parthasarathy

机构 * SERC, IIIT-Hyderabad(IIIT-海得拉巴的SERC) MontyCloud Inc(MontyCloud公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一个端到端的智能体评估框架,旨在评估智能体AI系统的行为,而不仅仅是任务完成度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13733 2025-12-17 cs.LG cs.AI 62%

Low-Rank Compression of Language Models via Differentiable Rank Selection

通过可微分秩选择实现语言模型的低秩压缩

Sidhant Sundrani, Francesco Tudisco, Pasquale Minervini

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LLRC通过可微分方法实现语言模型的低秩压缩,在无需微调的情况下提升压缩率与下游任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12045 2025-12-17 cs.HC cs.AI 57%

AI as a Teaching Partner: Early Lessons from Classroom Codesign with Secondary Teachers

AI作为教学伙伴:与中学教师课堂共同设计的初步经验

Alex Liu, Lief Esbenshade, Shawon Sarkar, Zewei Tian, Min Sun, Zachary Zhang, Thomas Han, Yulia Lapicus, Kevin He

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究探讨了AI在中学课堂中的应用,通过教师与AI的共同设计,评估AI在教学中的作用及改进需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14138 2025-12-17 cs.HC cs.AI 57%

LAPPI: Interactive Optimization with LLM-Assisted Preference-Based Problem Instantiation

LAPPI:基于LLM的偏好驱动问题实例化交互优化

So Kuroki, Manami Nakagawa, Shigeo Yoshida, Yuki Koyama, Kozuno Tadashi

机构 * Sakana AI University of California, Davis(加州大学戴维斯分校) OMRON SINIC X Corporation(OMRON SINIC X公司) University of Tokyo(东京大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 LAPPI通过LLM辅助用户将模糊偏好转化为明确的优化问题,提升终端用户在旅行计划等任务中的问题实例化效率和解决方案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13860 2025-12-17 cs.SE cs.AI 57%

Verification-Guided Context Optimization for Tool Calling via Hierarchical LLMs-as-Editors

通过分层大语言模型作为编辑器进行工具调用的验证引导上下文优化

Henger Li, Shuangjie You, Flavio Di Palo, Yiyue Qian, Ayush Jain

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 通过分层LLM作为编辑器,验证引导上下文优化提升工具调用的准确性和泛化能力。

Comments Accepted by AAAI 2026 Workshop on Agentic AI Benchmarks and Applications for Enterprise Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13747 2025-12-17 cs.CV cs.AI 57%

Why Text Prevails: Vision May Undermine Multimodal Medical Decision Making

为何文本占上风:视觉可能损害多模态医疗决策制定

Siyuan Dai, Lunxiao Li, Kun Zhao, Eardi Lila, Paul K. Crane, Heng Huang, Dongkuan Xu, Haoteng Tang, Liang Zhan

机构 * University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷大学) University of Pittsburgh(匹兹堡大学) NC State University(北卡罗来纳州立大学) University of Washington(华盛顿大学) University of Maryland(马里兰大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究发现文本推理在医疗多模态决策中优于多模态输入,提出三种策略以提升多模态医疗决策能力。

Comments Accepted by ICDM 2025 the Workshop on Synergy of AI and Multimodal Biomedical Data Mining

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16097 2025-12-17 cs.AI 57%

Developing Large Language Models for Clinical Research Using One Million Clinical Trials

利用一百万项临床试验开发大型语言模型用于临床研究

Zifeng Wang, Jiacheng Lin, Qiao Jin, Junyi Gao, Jathurshan Pradeepkumar, Pengcheng Jiang, Zhiyong Lu, Jimeng Sun

机构 * Usher Institute, Edinburgh Medical School, University of Edinburgh(埃丁堡大学埃丁堡医学院usher研究所) Health Data Research UK(英国健康数据研究) School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算与数据科学学院) Division of Intramural Research, National Library of Medicine, National Institutes of Health(国家卫生研究院国家医学图书馆内部研究部) Keiji AI

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TrialPanorama,通过整合一百万项临床试验数据,训练出在八个关键临床研究任务中表现优于通用大语言模型的8B LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14336 2025-12-17 cs.CV 50%

Vector Prism: Animating Vector Graphics by Stratifying Semantic Structure

向量棱柱:通过分层语义结构来动画化向量图形

Jooyeol Yun, Jaegul Choo

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种通过分层语义结构来提升向量图形动画质量的框架,通过统计汇总弱预测来恢复语义,从而提高VLMs动画生成的连贯性和准确性。

Comments yeolj00.github.io/personal-projects/vector-prism

详情

展开后加载摘要…

URL PDF HTML 收藏