arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-31 至 2026-08-31 共收录 116 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2511.14684 2026-08-31 cs.CL 版本更新 85%

SMRC: Aligning Large Language Models with Student Reasoning for Mathematical Error Correction

SMRC:使大语言模型与学生数学推理对齐以进行数学错误修正

Biaojie Zeng, Min Zhang, Juan Zhou, Fengrui Liu, Ruiyang Huang, Yu Song, Xin Lin

机构 * East China Normal University(华东师范大学) East Chine Normal University(华东师范大学) Southeast University(东南大学)

专题命中 数学推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL

AI总结 该研究针对大语言模型数学推理错误的教育场景修正需求,提出SMRC方法,结合MCTS等技术构建高中数学基准MSEB,实验显示其在多数据集上性能优于现有方法。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08577 2026-08-31 cs.CL cs.AI cs.LG cs.PF 版本更新 82%

Think-at-Hard: Dynamic Looped Transformers for Improved Reasoning

Think-at-Hard: 选择性潜在迭代以改进推理语言模型

Tianyu Fu, Yichen You, Zekai Chen, Guohao Dai, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对循环变压器中潜在过思考问题,提出Think-at-Hard方法,通过轻量级决策器选择性地在困难令牌上触发潜在迭代,并采用深度感知LoRA和双因果注意力机制,在数学、问答和编码任务上一致提升性能。

Comments Accepted by ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28447 2026-08-31 cs.AI 新提交 79%

Learning to Use Tools: Reinforcement Learning for Tool-Integrated Mathematical Reasoning

学习使用工具:用于工具集成数学推理的强化学习

Minghui Xu, Zi Wang

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对Countdown任务,构建工具使用的SFT数据集并采用多种强化学习方法,结合计算器工具集成提升LLM数学推理,使pass@1达66.0%,显著降低计算与验证错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27501 2026-08-31 cs.CL 新提交 79%

INSPIRE: An Internalize-Then-Improve Approach for Example-Driven Mathematical Reasoning

INSPIRE:一种用于示例驱动数学推理的“先内化再改进”方法

Shuai Wang, Jiayi Kuang, Yinghui Li, Haojing Huang, Xinnian Liang, Ying Shen, Liang Lin

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) ByteDance Inc.(字节跳动公司) Peng Cheng Laboratory(鹏城实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对LLMs数学推理中内化不足的问题,提出INSPIRE方法,结合RGSI与分阶段规则偏好训练,提升了示例驱动数学推理能力且未降低通用推理水平。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28481 2026-08-31 cs.CL cs.AI 新提交 62%

NL2AGBench: Benchmarking LLM Auto-Formalization for AlphaGeometry

NL2AGBench:面向AlphaGeometry的大语言模型自动形式化基准测试

Samuel Xiao, Judy Song, Rory Hu, Ziliang Zong

机构 * Valley Christian High School(谷基督高中) Vandegrift High School(范德格里夫特高中) Groton School(格罗顿学校) Texas State University(德克萨斯州立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出NL2AGBench基准,评估LLMs将英文几何问题转换为AlphaGeometry兼容形式化表示的能力,发现闭源模型可实现80%以上可执行翻译率,开源模型表现欠佳,还提出错误分类法并验证了多种缓解策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27513 2026-08-31 cs.LG cs.AI 新提交 62%

DAMP: Decay-Aware Mixed-Precision Recurrent-State Quantization

DAMP:感知衰减的混合精度循环状态量化

Tao Zhang, Jianchao Tan, Pingwei Sun, Yanqi Yu, Zixu Jiang, Yuchen Xie, Xunliang Cai, Ziqian Zeng

机构 * South China University of Technology(华南理工大学) Meituan(美团) East China Normal University(华东师范大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DAMP是针对GDN、KDA类语言模型循环状态的混合精度量化方法,通过识别高风险通道差异化精度存储,在接近FP32基线精度的同时大幅降低存储、加速更新并减少推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 逻辑推理 5 篇

2608.28435 2026-08-31 cs.RO 新提交 82%

Linear Temporal Logic Translation via Human-Inspired Self-Constrained Reasoning for Robot Task Specification

面向机器人任务规范的、基于类人自约束推理的线性时态逻辑翻译

Haofei Hou, Fanxu Meng, Shunyi Zhao, Kairui Yang, Mengchen Cai, Lecheng Ruan, Qining Wang

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) School of Integrated Circuits, Peking University(北京大学集成电路学院)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 该研究提出自约束推理(SCR)框架,将结构知识内化到模型决策中,以在不破坏推理的前提下,提升将人类指令翻译为线性时态逻辑(LTL)时的领域约束满足度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01335 2026-08-31 cs.CV cs.AI 版本更新 74%

Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning

超越像素:通过基于模式的代理推理实现视觉隐喻转移

Yu Xu, Yuxin Zhang, Lin Gao, Oliver Deussen, Tong-Yee Lee, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文脉) University of Konstanz(康斯坦茨大学) National Cheng-Kung University(国立成功大学)

专题命中 逻辑推理 :reasoning(title);分类 cs.AI

AI总结 本文提出基于模式的代理推理框架,实现视觉隐喻转移,通过多代理协作提升隐喻生成的抽象逻辑与视觉创造力。

Comments Accepted to SIGGRAPH ASIA 2026; Project page: this https URL (https://yuci-gpt.github.io/Beyond-Pixels/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28421 2026-08-31 cs.AI 新提交 57%

Program Learning with Verifiable Rewards: Symbolic Backpropagation for Post-Training LLMs

可验证奖励的程序学习:针对后训练大语言模型的符号反向传播

Vishvesh Bhat

机构 * CoreThink AI

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PLVR方法,通过符号反向传播从输入输出示例学习显式程序,在代码基准上提升大语言模型推理能力,边际成本低且效果优于RL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27869 2026-08-31 cs.AI 新提交 57%

See, Hypothesize, Validate: Multimodal Agentic Framework for Discovering Governing PDEs

观测、假设、验证:用于发现控制偏微分方程的多模态智能体框架

Sarang Manoj Pekhale, Amartya Roy, Rajat Sarkar, Souvik Chakraborty

机构 * Indian Institute of Technology Delhi(印度德里理工学院) Robert Bosch GmbH(罗伯特·博世有限公司) TCS Research(塔塔咨询服务公司研究院) Yardi School of Artificial Intelligence (ScAI)(亚迪人工智能学院) Department of Applied Mechanics(应用力学系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出多模态智能体框架MAGE,通过四个专业化智能体协作迭代发现控制PDE,在经典PDE套件等测试中实现优异恢复与误差表现,支持无库控制定律发现的结构化智能体推理研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07261 2026-08-31 cs.CL 版本更新 57%

Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models

仅知道两跳信息是不够:理解语言模型中的两跳泛化

Zili Zhang, Yilin Wang, Heng Wang, Herun Wan, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究针对语言模型两跳查询失败问题,在受控环境训练Transformer,揭示其泛化规律与跨层不匹配机制,提出循环式训练策略以提升分布外两跳泛化能力。

Comments EMNLP 2026, findings

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 29 篇

2507.20409 2026-08-31 cs.CL cs.AI cs.CY 版本更新 91%

Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations

认知链式推理(CoCoT):关于社会情境的结构化多模态推理

Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

机构 * Seoul National University(首尔国立大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);planning(abstract)

AI总结 本文提出CoCoT框架,通过感知、情境推断和规范应用三个阶段提升多模态社会推理能力,在多个任务中取得显著提升。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28270 2026-08-31 cs.RO cs.AI 新提交 83%

Spatial-Semantic Reasoning using Large Language Models for Efficient UAV Search Operations

基于大语言模型的空间语义推理用于高效无人机搜索任务

Marin Maletic, Marijana Peti, Tamara Petrovic, Stjepan Bogdan

机构 * University of Zagreb(萨格勒布大学) Faculty of Electrical Engineering and Computing(电气工程与计算机学院) LARICS (Laboratory for Robotics and Intelligent Control Systems)(拉里克机器人与智能控制系统实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 该研究提出基于大语言模型的无人机实时语义导航框架,结合多技术实现高效目标导航,经仿真与真实实验验证可缩短任务时长且保持高搜索准确率。

Comments 8 pages, preprint, Published in: 2025 European Conference on Mobile Robots (ECMR), DOI: https://doi.org/10.1109/ECMR65884.2025.11163229

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27847 2026-08-31 cs.AI 新提交 83%

From Uncertainty to Clinical Risk: Severity-Aware Conformal Planning for Interactive Medical Diagnosis

从不确定性到临床风险:面向交互式医疗诊断的严重程度感知共形规划

Yue Zhou, Haiyang Zhou, Jin Zhang, Kong Wang, Yongxin Ni, Youhua Li, Hanwen Du

机构 * Lanzhou University(兰州大学) Hunan University(湖南大学) National University of Singapore(新加坡国立大学) City University of Hong Kong(香港城市大学) The Ohio State University(俄亥俄州立大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对交互式医疗诊断漏诊重症的风险与长程规划缺失问题,提出严重程度感知共形临床规划框架,在DDXPlus和MediQ上提升了诊断准确性、鉴别质量并降低了高风险错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26086 2026-08-31 cs.LG cs.AI 版本更新 81%

TraceML: An Empirical Analysis of Human-Agent Planning in Machine Learning Development

TraceML:机器学习开发中人类-智能体规划的实证分析

Jiarui Yan, Weiwei Sun, Sijie Li, Wenhan Li, Yiming Yang

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 TraceML通过构建人类与智能体在Kaggle竞赛中的配对轨迹数据集,实证分析了人类与智能体在机器学习开发规划上的差异,发现智能体存在行为循环问题,提炼的人类规划提示可缩小部分差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28300 2026-08-31 cs.RO cs.AI 新提交 79%

MaCoPlanner: LLM-Assisted Manual-Compiled Task Planning with Proactive Safety Verification for Robotic Industrial Panel Operation

MaCoPlanner:面向机器人工业面板操作的、结合主动安全验证的大语言模型辅助人工编译任务规划

Guipeng Xin, Jiahe Xua, Mohammad Deghat, Chenhui Wan, Jie Liu, Youmin Hu, Zhongxu Hu

机构 * Huazhong University of Science and Technology(华中科技大学) University of New South Wales(新南威尔士大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 MaCoPlanner是面向机器人工业面板操作的规划框架,通过编译设备手册知识生成规划,经主动安全验证后执行,大幅提升了任务成功率,在Level-2、Level-3任务上分别提升了21.6、17.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19151 2026-08-31 cs.AI cs.MA 版本更新 79%

Multimodal Collaborative Debate for Zero-Shot Time Series Reasoning

TS-Debate:多模态协作辩论用于零样本时间序列推理

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST Seoul(韩国科学技术院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TS-Debate通过多模态协作辩论框架,在零样本时间序列推理中实现显著性能提升,通过专门代理和结构化协议提升模态保真度和数值精度。

Comments EMNLP 2026 (Main), Project Page: this https URL (https://deepauto-ai.github.io/ts-debate/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28075 2026-08-31 cs.RO 新提交 78%

Plan Along the Way: Event-Triggered Foundation-Model Planning for TAMP Execution in Partially Observable Manipulation

动态规划:部分可观测操纵任务中用于TAMP执行的事件触发式基础模型规划

Puru Ojha, Narendhiran Vijayakumar, Nav Singhal, Girish Varma, Antony Thomas

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) Center for Security, Theory and Algorithmic Research, IIIT Hyderabad(IIIT海得拉巴安全、理论与算法研究中心)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出ROBUST TAMP框架,针对部分可观测操纵任务,通过事件触发式重规划机制提升TAMP执行的任务成功率,验证了其在6个RLBench/CoppeliaSim场景中的有效性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27871 2026-08-31 cs.CV 新提交 78%

Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding

时序思维树:面向长视频理解的推理引导型视觉线索搜索

Ziling Huang, Shin'ichi Satoh

专题命中 规划推理 :reasoning(title,abstract)

AI总结 该研究针对MLLMs长视频理解的时序组织缺失问题,提出无训练的T³框架,通过分层时序树与“回答-检索-探索”循环实现粗到细的线索搜索,在三个基准数据集上提升了Qwen2.5-VL-7B的性能。

Comments Accept by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27726 2026-08-31 cs.RO 新提交 78%

Coordinated Motion Planning for Multi-Arm Systems via Iterative LQ Games

基于迭代LQ博弈的多机械臂系统协调运动规划

Junyoung Kim, Hanwen Ren, Lei Zhang, Ahmed H. Qureshi

机构 * Purdue University(普渡大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出迭代LQ博弈框架用于多机械臂协调运动规划,通过可微碰撞惩罚生成安全高效轨迹,性能优于传统方法,凸显微分博弈在多机器人操作中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01113 2026-08-31 cs.RO 版本更新 78%

From Dialogue to Execution: Mixture-of-Agents Assisted Interactive Planning for Behavior Tree-Based Long-Horizon Robot Execution

从对话到执行:基于混合代理的交互式规划用于基于行为树的长时域机器人执行

Kanata Suzuki, Kazuki Hori, Haruka Miyoshi, Shuhei Kurita, Tetsuya Ogata

机构 * Waseda University(早稻田大学) National Institute of Informatics(国家信息研究所) NII Research and Development Center for Large Language Models(国家信息研究所大型语言模型研究开发中心) The Graduate University for Advanced Studies (SOKENDAI)(高级研究大学研究生院(SOKENDAI))

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出基于混合代理的交互式规划框架,通过生成行为树实现长时域机器人任务的高效执行,减少人类干预并提升执行质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28266 2026-08-31 cs.RO 新提交 71%

CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning

CoCoBench:用于具身多智能体任务规划的协作协调基准

Yang Chen, Ye-Xin Xie, Lirong Che, Danyang Peng, Yuzhe Yang, Peiwen Lin, Xu Cao, Chuang Wang, Lei Yuan, Jian Su, Lan-Zhe Guo

机构 * Nanjing University(南京大学) AgiBot Tsinghua University(清华大学)

专题命中 规划推理 :planning(title)

AI总结 研究人员提出CoCoBench这一家庭任务多智能体具身协调基准,评估11种MLLM后发现协调能力具构造特异性,为相关模型设计提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28490 2026-08-31 cs.CR cs.AI 新提交 70%

LLM-Based Agents for Software and Systems Security: Approaches, Applications, and Assessment

基于大语言模型(LLM)的软件与系统安全智能体:方法、应用与评估

Jingjing Nie, Jiawei Guo, Krishna Meda, Haipeng Cai

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文通过系统综述2023-2026年的同行评审文献,梳理基于LLM的软件与系统安全智能体的技术方法、应用及评估,指出当前智能体权限未受限、行为不可审计的局限,并展望未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28476 2026-08-31 cs.CL 新提交 70%

ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL

ContextPilot:通过细粒度强化学习为智能体教授主动上下文管理

Zhuoshi Pan, Qizhi Pei, Junru Lu, Honglin Lin, H. Vicky Zhao, Di Yin, Xing Sun

机构 * Tsinghua University(清华大学) Tencent(腾讯) Shanghai AI Lab(上海人工智能实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本研究针对现有主动上下文管理方法的局限,提出ContextPilot框架,通过扩充工具集并设计细粒度RL方法,在长程智能体任务中实现更紧凑上下文下的更优性能,优于现有基线。

Comments 10 pages, 6 figures, 5 tables, accepted to EMNLP 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28062 2026-08-31 cs.AI 新提交 70%

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents

WeAgent-MMSearch:面向多模态搜索智能体的原生文本-视觉交互

Zongkai Liu, Hui Zhang, Liqiang Niu, Zhen Cao, Han Li, Juntao Liu, Wenchao Chen, Chengduo Zhao, Chao Yu, Fandong Meng

机构 * Weixin AI, Tencent(腾讯微信人工智能) Sun Yat-sen University(中山大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对现有多模态搜索智能体忽略图像、长程交互易失败的问题,提出 WeAgent-MMSearch 系统,通过 WeAgent-Harness 实现文本-视觉交互,经 FA-GSPO 后训练后,模型在多模态搜索基准上性能大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27506 2026-08-31 cs.AI 新提交 70%

Thinking Costs Tokens: When More Structure is Worth the Price

思考成本即 token:更多结构何时值得付出代价

Thomas Nolasque, John Grey, Calista Pham, Ankit Vani

机构 * Royal Bank of Canada(加拿大皇家银行)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文研究语言模型推理结构的 token 预算阈值,在 FinQA、TAT-QA 任务上用 GPT-5.4 mini 验证,1500 token 后验证搜索架构性能优于单体模型,交叉点在 1000-1500 token 间。

Comments 8 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26747 2026-08-31 cs.AI 版本更新 70%

AgentFold: Closed-Loop Agentic Search for Protein Folding Model Design

AgentFold:用于蛋白质折叠模型设计的闭环智能体搜索

Mingquan Liu, Jiangyu Chen, Hanqun Cao, Xujun Zhang, Pengsen Ma, Xiangru Tang, Shuting Jin, Zhuo Yang, Annie Zheng, Tianfan Fu, Fang Wu, Xiangxiang Zeng

机构 * Hunan University(湖南大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Yale University(耶鲁大学) Wuhan University of Science and Technology(武汉科技大学) Southeast University(东南大学) Stanford University(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 AgentFold是将蛋白质折叠模型开发转化为闭环搜索的多智能体框架,以ESMFold为起点,通过MCTS策略分配计算资源,在匹配预算下较Codex提案提升lDDT 7.5%,优于随机搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10891 2026-08-31 cs.LG cs.AI cs.CV cs.RO eess.SY 版本更新 62%

Transformer-Based Autonomous Driving Models and Deployment-Oriented Compression: A Survey

基于Transformer的自动驾驶模型与面向部署的压缩:综述

Juan Zhong, Yuhang Shi, Zukang Xu, Xi Chen

机构 * Renmin University of China(中国人民大学) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Academy of AI for Science(上海人工智能科学研究院) Department of houmo.ai(houmo.ai部门)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了基于Transformer的自动驾驶模型,并从部署角度分析了压缩与加速策略(如量化、剪枝、知识蒸馏等)如何影响模型设计、部署性、鲁棒性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28373 2026-08-31 cs.HC cs.AI 新提交 57%

AI as Teammate: Rethinking Task Distribution in Medical Training

AI作为队友:重新思考医学培训中的任务分配

Fendi Tsim, Alina Gutoreva, Anthony Weiss, Nicole Dubosh

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出将医学培训中AI的问题从“误用”重构为“分类错误”,提出以人为中心的SCAN决策框架,为医学教育中AI的应用提供可检验的认知科学实证研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27818 2026-08-31 cs.AI 新提交 57%

AcCoRD: Evaluating User-Agent Collaboration Under Realistic User Preference Dynamics

AcCoRD:评估现实用户偏好动态下的用户-智能体协作

Tejas Srinivasan, Shikib Mehri, Nandita Shankar Naik, Anirban Das, William M. Campbell, Jesse Thomason

机构 * University of Southern California(南加州大学) Contextual AI(Contextual AI公司) Capital One(第一资本金融公司) Georgia Tech University(佐治亚理工大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究针对现有用户-智能体协作基准无法捕捉偏好动态的问题,推出AcCoRD基准,评估前沿LLM处理偏好动态的能力,发现模型难应对交互中出现/演变的偏好,仅提示无法实现所需不确定性识别。

详情

展开后加载摘要…

URL PDF HTML 收藏