arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11120 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11120 篇

2606.00049 2026-06-02 cs.CY cs.AI 57%

Measuring and Mitigating Bias in Code Generated by Large Language Models

测量和减轻大型语言模型生成代码中的偏见

Yuxi Chen, Yutian Tang, Timothy Storer

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文针对GPT-4o和Gemini等主流代码生成工具,提出评估框架,使用代码偏见分数和属性变化比率量化偏见,并探索四种轻量级缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00013 2026-06-02 cs.CY cs.AI cs.HC 57%

A phenomenon of AI-conformity: how algorithms change human moral decision-making

AI从众现象:算法如何改变人类道德决策

Yana Venerina, Dmitry Koch, Nare Meloyan, Gerda Prutko, Valeriia Lelik, Victoria Taova, Andrey Kurpatov

机构 * Neuroscience Laboratory, Sberbank, Moscow, Russia(神经科学实验室,俄罗斯储蓄银行,莫斯科)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过改编经典Asch范式,发现具有推理能力的AI模型对人类道德判断的影响程度与人类多数相当,表明道德决策也可能受到算法从众的影响。

Comments 31 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00008 2026-06-02 cs.AI 57%

Agents on a Tree: Pathwise Coordination for Multi-Objective Molecular Optimization

树上的智能体:多目标分子优化的路径协调

Jia Zhang, Tengfei Ma, Tianle Li, Daojian Zeng, Xieping Gao, Xiangxiang Zeng

机构 * College of Information and Science(信息科学学院) Hunan Normal University(湖南师范大学) College of Computer Science(计算机科学学院) Electronic Engineering, Hunan University(电子工程学院,湖南大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出ATOM多智能体框架,将分子优化建模为树结构搜索,通过路径协调实现多目标权衡,在活性、可合成性和ADMET相关性质上优于基线。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30190 2026-06-02 cs.LG 57%

Mean-Field Diffuser: Scaling Offline MARL to Thousands of Agents

均场扩散器:将离线多智能体强化学习扩展到数千个智能体

Wenhao Li, Xiangfeng Wang, Bo Jin

机构 * Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 提出MF-Diffuser框架,通过将轨迹规划提升到轨迹分布的Wasserstein空间,并利用混沌传播和分层粗到细策略,将离线多智能体强化学习扩展到数千个智能体,理论证明均场近似误差为$O(H^2/\sqrt{N})$且离线分布偏移不随群体规模增长,实验在三个均场RL基准上取得最佳回报。

Comments 62 pages, 15 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17456 2026-06-02 cs.AI 57%

TrafficClaw: A Generalizable LLM Agent in the Unified Physical Environment for Urban Traffic Control

TrafficClaw:面向城市交通控制的统一物理环境中的可泛化LLM智能体

Siqi Lai, Pan Zhang, Yuping Zhou, Jindong Han, Yansong Ning, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Shandong University(山东大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出TrafficClaw,一种基于大语言模型的可泛化交通控制智能体,通过统一物理环境、可执行时空推理与多阶段智能体强化学习,实现跨子系统的协调优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07436 2026-06-02 cs.AI 57%

LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services

LocalSearchBench:现实本地生活服务中的智能搜索基准测试

Hang He, Chuhuai Yue, Chengqi Dong, Mingxue Tian, Hao Chen, Zhenfeng Liu, Jiajun Chai, Xiaohan Wang, Yufei Zhang, Qun Liao, Guojun Yin, Wei Lin, Chengcheng Wan, Haiying Sun, Ting Su

机构 * Meituan, Beijing, China(美团,北京,中国) East China Normal University Shanghai Innovation Institute(东华大学上海创新研究院) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) North China University of Technology, Beijing, China(华北理工大学,北京,中国) East China Normal University Shanghai China(东华大学上海)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对本地生活服务领域,提出包含130万商家条目和900个多跳问答任务的基准测试LocalSearchBench,并开发统一环境LocalPlayground,实验表明现有大推理模型性能不足。

Comments 12 pages; accepted to KDD 2026

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD 2026), August 9--13, 2026, Jeju Island, Republic of Korea. ACM, New York, NY, USA, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03309 2026-06-02 cs.CV cs.AI 57%

VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models

VLM4VLA:重新审视视觉-语言-动作模型中的视觉-语言模型

Jianke Zhang, Xiaoyu Chen, Qiuyue Wang, Mingsheng Li, Yanjiang Guo, Yucheng Hu, Jiajun Zhang, Shuai Bai, Junyang Lin, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Qwen Team, Alibaba Inc.(阿里巴巴公司Qwen团队)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文通过VLM4VLA最小适配管道,系统研究视觉-语言模型(VLM)的选择和能力如何影响下游视觉-语言-动作(VLA)策略性能,发现VLM通用能力无法预测下游任务表现,且视觉模块是性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14460 2026-06-02 cs.CL 57%

Agent-R1: A Unified and Modular Framework for Agentic Reinforcement Learning

Agent-R1:一个统一且模块化的智能体强化学习框架

Mingyue Cheng, Shuo Yu, Daoyu Wang, Qingchuan Li, Xiaoyu Tao, Jie Ouyang, Yucong Luo, Yitong Zhou, Qi Liu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出Agent-R1框架,通过步骤级轨迹表示和灵活上下文管理,解决智能体强化学习中轨迹表示不匹配问题,支持多种优化策略。

Comments This paper serves as the technical report of the Agent-R1 project

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31365 2026-06-01 cs.AI 57%

Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration

学习适应:通过认知感知探索实现自我改进的网络智能体

Weile Chen, Bingchen Miao, Qifan Yu, Wendong Bu, Guoming Wang, Wenqiao Zhang, Shengyu Zhang, Juncheng Li, Siliang Tang

机构 * Zhejiang University(浙江大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出SCALE框架,利用选择器、预测器和评判器三个对抗角色,通过环境探索自主发现智能体局限性并扩展认知边界,结合SCALE-Hop图探索策略和SCALE-20k数据集,显著提升多模态大语言模型在多种网络环境中的性能和泛化能力。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31273 2026-06-01 cs.LG 57%

Survival Reinforcement Learning: Toward Scalable Self-Supervised RL

生存强化学习:迈向可扩展的自监督强化学习

Franki Nguimatsia-Tiofack, Fabian Schramm, Théotime Le Hellard, Justin Carpentier

机构 * Inria and École Normale Supérieure PSL Research University(Inria 和 法国国家科学研究中心巴黎大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 提出生存强化学习(SRL),一种基于在线分类的方法,通过最大化智能体在目标状态停留时间来解决对比强化学习中的均匀性-容忍性困境,在长时程运动任务上性能提升2至8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31224 2026-06-01 cs.CY cs.AI cs.HC 57%

Comparing LLM-Based Conversational and Graphical Interfaces for Industrial Decision Tasks: An Exploratory Mixed-Methods Study

基于LLM的对话式与图形化界面在工业决策任务中的比较:一项探索性混合方法研究

Roberto Figliè, Simone Caputo, Alan Serrano, Tommaso Turchi, Daniele Mazzei

机构 * Department of Computer Science(计算机科学系) University of Pisa(比萨大学) Department(部门) San Matteo Hospital(圣玛泰奥医院) Brunel University of London(伦敦布鲁内尔大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 通过混合方法研究,比较了基于LLM的对话式界面与图形化仪表盘在工业决策任务中的表现,发现对话式界面可减少交互努力,但仪表盘在概览和验证方面仍有价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31138 2026-06-01 cs.HC cs.AI 57%

Developing an AI-Powered UX Research Point of View for Digital Health in A Regulatory Context: An Exemplar Case from MSM and Transgender HIV Care in Nigeria

在监管背景下开发AI驱动的用户体验研究视角:以尼日利亚MSM和跨性别者HIV护理为例

Emmanuel Oluwatosin Oluokun, Festus Fatai Adedoyin, Huseyin Dogan, Nan Jiang, Melike Akca, Abiodun Adedeji, Olumuyiwa Ayorinde, Fatima Ahmad Muazu

机构 * School of Computing and Engineering, Bournemouth University(伯恩茅斯大学计算与工程学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种生成式AI增强的用户体验研究方法论,通过四阶段UXR流程和十张理论驱动的UXR游戏卡,指导尼日利亚男男性行为者(MSM)和跨性别者HIV护理中数字健康干预的设计,核心贡献是可复制的、关注污名和隐私的负责任GenAI使用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31131 2026-06-01 cs.HC cs.AI 57%

UXR PoV for Neuroinclusive Emotion Regulation

神经包容性情绪调节的用户体验研究观点

Melike Akca, Mona Giff, Deniz Cetinkaya, Huseyin Dogan, Stephen Giff

机构 * School of Computing and Engineering, Bournemouth University(伯恩茅斯大学计算机与工程学院) Google Redmond, Washington, USA(谷歌红mond分公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种生成式AI增强的用户体验研究方法,结合DBT、SDT和COM-B理论框架,通过四阶段流程生成十张UXR游戏卡,为ADHD成人设计神经包容性的数字情绪调节干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31111 2026-06-01 cs.LG 57%

Subspace-Decomposed JEPAs: Disentangling Progression and Content in Latent World Models

子空间分解的JEPA:解耦潜在世界模型中的进展与内容

Lucas Thil, Jesse Read, Rim Kaddah, Guillaume Doquet

机构 * LIX, École Polytechnique(巴黎高等学院LIX实验室) IRT SystemX(系统X研究院) Safran Tech(萨弗兰科技)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 提出SD-JEPA方法,通过将JEPA潜在空间分解为正交的进展子空间和内容子空间,利用余弦边际三元组损失和SIGReg正则化分别约束,在控制基准上优于LeWM基线,并证明进展坐标可作为场景感知的指南针。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30961 2026-06-01 cs.CL 57%

EvoGens: A Population-Based Heuristic Search Framework for Scientific Idea Generation

EvoGens:一种基于种群的启发式搜索框架用于科学思想生成

Xu Li, Hanzhe Tu, Xinyi Li, Kuncheng Zhao, Xun Han, Zhonghui Liu

机构 * Southwest Petroleum University(西南石油大学) Sichuan Police College(四川警察学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 针对现有LLM方法生成科学思想时语义趋同、多样性和新颖性不足的问题,提出EvoGens框架,通过进化搜索(变异、交叉、选择)增强思想探索,显著提升新颖性和多样性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30858 2026-06-01 cs.LG 57%

ForecastCompass: Guiding Agentic Forecasting with Adaptive Factor Memory

ForecastCompass: 自适应因子记忆引导的智能预测

Yurui Chang, Yongkang Du, Yuanpu Cao, Jinghui Chen, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 提出ForecastCompass框架,通过分层预测任务分类和双组件记忆(因子记忆与推理记忆),结合回顾分析迭代修正,提升智能体在动态环境中的概率预测准确性和校准性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30842 2026-06-01 cs.LG 57%

CoMem: Context Management with A Decoupled Long-Context Model

CoMem: 基于解耦长上下文模型的上下文管理

Yuwei Zhang, Chengyu Dong, Shuowei Jin, Changlong Yu, Hejie Cui, Hongye Jin, Xinyang Zhang, Hamed Bonab, Colin Lockard, Jianshu Chen, Zhenyu Shi, Jingbo Shang, Xian Li, Bing Yin

机构 * Halıcıoğlu Data Science Institute, University of California, San Diego(哈里卡卢斯数据科学研究所,加州大学圣地亚哥分校) Amazon(亚马逊)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 提出CoMem框架,通过将记忆管理与智能体工作流解耦并采用k步偏移异步流水线,利用奖励驱动训练策略,在SWE-Bench-Verified上实现1.4倍延迟改进且保持大部分性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30838 2026-06-01 cs.AI 57%

COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents

COMPASS: 认知MCTS引导的过程对齐用于安全搜索代理

Wenkai Shen, Pengyang Zhou, Jiahe Xu, Jiaming Qian, Haozhe He, Zhihao Huang, Chaochao Chen, Xiaolin Zheng

机构 * Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出COMPASS框架,通过认知树探索和自省步骤对齐,在保持通用效用的同时实现搜索代理工作流中的鲁棒安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30824 2026-06-01 cs.AI 57%

Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward

面向深度研究的规划器中心强化学习与结构感知奖励

Mustafa Anis Hussain, Xinle Wu, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出DecomposeR框架,通过将研究计划表示为有向无环图(DAG)并采用两阶段强化学习(规划器RL和回答器RL),实现显式结构化规划与细粒度奖励分配,在长文本基准上提升5.1-8.0分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30785 2026-06-01 cs.AI 57%

Learning Agent-Compatible Context Management for Long-Horizon Tasks

面向长时任务的学习智能体兼容上下文管理

Lu Yi, Runlin Lei, Liuyi Yao, Yuexiang Xie, Yuyang Li, Wenhao Zhang, Zhewei Wei, Yaliang Li, Jian-Yun Nie

机构 * Renmin University of China(中国人民大学) Tongyi Lab, Alibaba Group(阿里云实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Université de Montréal(蒙特利尔大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出AdaCoM方法,通过外部LLM对冻结智能体进行端到端强化学习上下文管理,在长时任务中提升性能并揭示保真度-可靠性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30542 2026-06-01 cs.AI 57%

Physically Viable World Models: A Case for Query-Conditioned Embodied AI

物理可行的世界模型:面向查询条件具身AI的案例

Adam J. Thorpe, Stepan Tretiakov, Cheng-Hsi Hsiao, Su Ann Low, Xingjian Li, Hassan Iqbal, Neel P. Bhatt, Ufuk Topcu, Krishna Kumar

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 针对具身AI中现有世界模型预测未来观测但物理不可行的问题,提出应构建基于查询条件、识别最简物理抽象的世界模型,通过模块化分解确保可解释性和可验证性。

Comments 21 pages; Adam J. Thorpe and Stepan Tretiakov contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27881 2026-06-01 cs.CL 57%

Retrieval, Reward, and Training Protocols: What Matters in Training Search Agents?

检索、奖励与训练协议:训练搜索代理的关键因素是什么?

Yibo Zhao, Zichen Ding, Jiayi Wu, Zun Wang, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(东华大学数据科学与工程学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文通过控制实验,系统研究了检索语料库、奖励设计和训练协议三个维度对搜索代理训练的影响,发现纠正语料覆盖问题比算法差异更有效,简单的基于结果的奖励方法在多数设置下表现优异,并提出了实用训练指南。

Comments 18pages, 4 figures, and 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22967 2026-06-01 cs.LG 57%

Learned Relay Representations for Forward-Thinking Discrete Diffusion Models

学习的中继表示用于前向思考的离散扩散模型

Benjamin Rozonoyer, Jacopo Minniti, Dhruvesh Patel, Neil Band, Avishek Joey Bose, Tim G. J. Rudner, Andrew McCallum

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Toronto(多伦多大学) Stanford University(斯坦福大学) Imperial College London(伦敦帝国学院) Mila Vijil

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 提出Learned Relay Representations (Relay)方法,通过可微通道传递潜在信息,使掩码扩散模型在去噪步骤间前向思考,减少推理延迟并提升性能。

Comments 16 pages, 3 figures. Equal contribution: Benjamin Rozonoyer, Jacopo Minniti, and Dhruvesh Patel. Code: https://github.com/jacopo-minniti/relay

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11946 2026-06-01 cs.AI 57%

Counterfactual Trace Auditing of LLM Agent Skills

LLM Agent技能的反事实痕迹审计

Xiaolin Zhou, Jinbo Liu, Li Li, Ryan A. Rossi, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Adobe Research(Adobe研究)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出反事实痕迹审计(CTA)框架,通过配对有无技能的Agent轨迹并生成结构化技能影响模式(SIP)注释,揭示技能对行为的重塑效应,弥补仅通过通过率评估的不足。

Comments Code and data are available at https://github.com/WillChow66/CTA.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06235 2026-06-01 cs.IR cs.AI 57%

OBLIQ-Bench: Exposing Overlooked Bottlenecks in Modern Retrievers with Latent and Implicit Queries

OBLIQ-Bench:揭示现代检索器中被忽视的瓶颈——潜在与隐式查询

Diane Tchuindjo, Devavrat Shah, Omar Khattab

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对现有检索基准饱和但实际搜索问题未解决的现象,提出一类“倾斜查询”并构建OBLIQ-Bench基准,揭示检索与验证之间的不对称性,即推理LLM能可靠识别潜在相关性但检索管道无法召回多数相关文档。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05529 2026-06-01 cs.DB cs.AI 57%

NGDBench: Towards Neural Graph Data Management

NGDBench:迈向神经图数据管理

Yufei Li, Yisen Gao, Jiaxuan Xiong, Jiaxin Bai, Shijie Zhong, Haoyu Huang, Zhongwei Xie, Hong Ting Tsang, Yangqiu Song

机构 * HKUST(香港理工大学) Beijing Institute of Technology(北京理工大学) Hong Kong Baptist University(香港 Baptist 大学) Guangdong University of Technology(广东技术大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对现有数据管理系统在噪声、不完整和动态更新下缺乏隐式结构发现和推理能力的问题,提出NGDBench基准,通过统一结构化与非结构化来源的图视图,评估神经查询方法在噪声和动态状态跟踪中的表现。

Comments https://github.com/HKUST-KnowComp/NGDBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12060 2026-06-01 cs.CR cs.AI cs.CY 57%

Organizational Adaptation to Generative AI in Cybersecurity

组织对生成式人工智能在网络安全中的适应

Christopher Nott

机构 * Independent Researcher, United States(美国独立研究者)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究通过分析2022至2025年的25项研究,采用定性方法探讨组织如何通过修改框架和混合操作流程适应生成式AI,发现成熟基础设施、监管压力和人力资本投资是成功的关键,同时指出攻防能力不平衡等挑战。

Comments 38 pages, 1 table, 1 figure Revised title, abstract, and formatting for journal submission, corrected heading numbers, no substantive changes in content

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30150 2026-05-29 cs.AI 57%

Anchorless Diversification for Parallel LLM Ideation

无锚点多样化并行LLM创意生成

Fares Nabil Ibrahim, Nafis Saami Azad, Raiyan Abdul Baten

机构 * Bellini College of Artificial Intelligence, Cybersecurity, and Computing, University of South Florida(贝尔尼人工智能、网络安全与计算学院,佛罗里达州立大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究无锚点方法(如语义方向分层)在并行LLM创意生成中实现候选池多样化,无需依赖种子想法,在多样性、质量和计算效率上优于有锚点基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29932 2026-05-29 cs.LG cs.CV 57%

Treatment-Conditioned Diffusion for Forecasting Neurodegenerative Disease Progression

治疗条件扩散用于预测神经退行性疾病进展

Danylo Boiko, Viktoriia Mishkurova

机构 * Innoloft Inc.(Innoloft公司) Bogomolets National Medical University(博戈莫列茨国家医学大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 提出一种治疗条件扩散框架,通过条件化生成过程于患者的筛查DaTscan图像和一年内左旋多巴等效日剂量,预测高保真未来脑状态,在临床保真度上显著优于基线。

Comments 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29791 2026-05-29 cs.CL 57%

ActTraitBench: Quantifying the Knowledge-Decision Gap in Large Language Models via Human-Grounded Behavioral Validation

ActTraitBench: 通过人类行为验证量化大型语言模型中的知识-决策差距

Yutong Yang, Chenxi Miao, Weikang Li, Yunfang Wu

机构 * Peking University(北京大学) Baidu Inc(百度公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出ActTraitBench框架,基于人类数据建立心理测量方面与行为范式的一一映射,并通过分位数映射校准LLM评分分布,揭示LLM在自我报告与行为决策之间的知识-决策差距,并引入CoCA干预来缓解该差距。

详情

展开后加载摘要…

URL PDF HTML 收藏