Drake: An Efficient Executive for Temporal Plans with Choice
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
Journal ref Journal Of Artificial Intelligence Research, Volume 42, pages 607-659, 2011
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
Journal ref Journal Of Artificial Intelligence Research, Volume 42, pages 607-659, 2011
专题命中 推理评测 :planning(abstract);分类 cs.AI
Journal ref Journal of Artificial Intelligence Research 47, pages 253-279
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
Comments Artificial Intelligence in Adversarial Real-Time Games 2012, Palo Alto : United States (2012)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
机构 * Florida Institute of Technology(佛罗里达理工学院) ; Knovel Engineering Lab(诺维尔工程实验室) ; Vietnam Military Medical University(越南军事医科大学) ; Military Central Hospital(108陆军中央医院) ; Can Tho University of Medicine and Pharmacy(芹苴医药大学) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
专题命中 推理评测 :reasoning(abstract,comments)
Comments CVPR Multimodal Algorithmic Reasoning Workshop 2025 - SilVarMed
专题命中 推理评测 :planning(abstract,comments)
Comments 13th International Conference on Design & Decision Support Systems in Architecture and Urban Planning. June 2016
谁获得奖励 & 谁受到责备?面向多LLM智能体的评估对齐训练信号
机构 * Argonne National Laboratory(阿贡国家实验室) ; University of Chicago(芝加哥大学)
专题命中 推理评测 :分类 cs.CL、cs.AI;reasoning(comments);planning(comments)
AI总结 提出一个理论框架,结合合作博弈归因与过程奖励建模,将系统级评估转化为智能体信用和消息级信号,用于多LLM智能体训练。
Comments Accepted at the NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models for Reasoning and Planning (LAW 2025)
Video-OPSD:利用特权视觉证据实现视频大语言模型中的在线自蒸馏
机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 该研究提出Video-OPSD框架,利用视频内特权视觉证据构建自教师并优化令牌级蒸馏,在多个视频基准上优于标准OPSD,性能接近GRPO且训练时间大幅缩短,为Video-LLMs提供高效后训练方法。
AudioSpan:覆盖音频理解的时长与深度
机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究提出覆盖10分钟至2小时音频的基准AudioSpan,含3240个分三认知层级的问题,评估12个大型音频-语言模型,发现从长音频提取相关事实是核心难点,该基准可公开获取。
StreamPI:面向视觉-语言-动作模型的流式多模态时序建模
机构 * The University of Hong Kong(香港大学) ; ACE Robotics(ACE机器人公司)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出StreamPI框架,为单帧VLA模型赋予时序推理能力,通过指令锚定时序建模、随机间隔流式训练等方法,在真实机器人与仿真基准任务上性能优于pi0.5。
答案很廉价,给我看证据!用证据增强自动化漏洞评估
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对现有自动化漏洞评估方法缺乏证据支持的问题,提出EAVA框架,通过LLM智能体和两阶段训练流程实现更优性能,且提供的证据对安全专家实用。
Comments accepted by ISSTA 26
SafeGesture:通过场景条件安全解释评估视觉语言模型的细粒度手势理解能力
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出SafeGesture基准,评估5款视觉语言模型的细粒度手势安全理解能力,发现模型存在感知与推理脱节,瓶颈为场景条件安全推理而非手势识别。
Comments 14 pages, 22 tables, 2 figures. Code and benchmark resources available at https://github.com/The-Responsible-AI-Initiative/SafeGesture
TIEM:用于事件驱动金融预测的超图证据与技能记忆的时间整合框架
专题命中 推理评测 :reasoning(abstract)
AI总结 该研究针对事件驱动金融预测中大型语言模型智能体存在的证据鸿沟问题,提出带时间戳门控的TIEM框架,引入FinPURE基准,经多组金融基准验证其性能优于现有基线。
GTPred:评估多模态大语言模型在可解释地理定位和拍摄时间预测中的基准测试
机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究院) ; School of Humanities, Shanghai Jiao Tong University(上海交通大学人文学院) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 GTPred是一个新的地理-时间预测基准测试,通过评估多模态大语言模型在可解释地理定位和拍摄时间预测中的表现,揭示了当前模型在世界知识和时空推理方面的局限性。
面向大语言模型增强的Android污点分析
专题命中 推理评测 :reasoning(abstract)
AI总结 本文探究商用LLM能否有效推理Android应用的污点流,提出智能体交互策略,在DroidBench基准上Gemini-3 Flash的F1分数达0.96(优于FlowDroid的0.55),还能识别真实应用中FlowDroid未发现的潜在数据泄露,可补充传统静态污点分析。
用于乳腺超声诊断的通才-专家模型协作的引导与反馈框架
机构 * Monash University(莫纳什大学) ; Renmin University of China(中国人民大学) ; Lancaster University(兰卡斯特大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对乳腺超声诊断中深度学习的可靠性与可解释性难题,提出BooF框架实现MLLM与专家模型协作,经多数据集验证其性能优于现有最优方法。
Comments 5 pages, 2 figures. Published in ICASSP 2026
Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026
针对TLS 1.3密码依赖项的CRQC+AI漏洞谱的基于场景的评估
专题命中 推理评测 :reasoning(abstract)
AI总结 本文基于四场景能力模型评估TLS 1.3密码依赖项的CRQC+AI漏洞谱,明确NIST算法未被破解,提出PQC迁移强制要求及相关补充措施。
Comments 23 figures, 68 pages total
Cloud-OpsBench: 一种可重现的云系统代理根本原因分析基准
专题命中 推理评测 :reasoning(abstract)
AI总结 Cloud-OpsBench 是一个用于云系统代理根本原因分析的可重现基准,通过构建确定性数字孪生,提供数据引擎、强化学习环境和诊断标准,支持下一代SRE研究。
Comments 14 pages, 3 figures
一个用于高级多模态个性化研究的基准和知识引导框架
机构 * Google(谷歌) ; DeepMind(深Mind)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出Life-Bench基准和LifeGraph框架,用于解决高级多模态个性化研究中的复杂任务挑战。
CiUNet:用于医学图像分割的混合Swin-CNN UNet
机构 * Ciphowork GmbH(Ciphowork有限公司)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对医学图像分割的隐私、效率需求,提出基于Swin-UNet的混合架构,融合并行CNN编码器与XSkip连接等,在Synapse数据集上实现SOTA分割性能,为临床部署提供可行方案。
Comments 14 pages, 3 figures. The demo predictor and trained weights are available at:https://github.com/ciphoBD/CiUNet
AI时代的评价:输出作为学习的证据
专题命中 推理评测 :reasoning(abstract)
AI总结 本文探讨AI时代大学教育评价的伦理挑战,指出传统评价指标易被AI外包的问题,提出需转向重视过程的替代评价模式,以保留学生自主性与问责制。
Comments 12 pages, 1 figure, 1 table
MedReaMM:评估大型多模态模型在专家级临床诊断综合能力上的表现
机构 * The First Affiliated Hospital with Nanjing Medical University(南京医科大学第一附属医院) ; Jiangsu Province Hospital(江苏省医院) ; Huazhong University of Science Technology(华中科技大学) ; Fudan University(复旦大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究构建了多模态临床诊断基准MedReaMM,评估23个大型多模态模型的诊断综合能力,发现多数模型准确率不足50%,揭示了该领域的能力差距及相关影响因素。
结合问题信息的大语言模型增强型提交消息生成:一项探索性研究
专题命中 推理评测 :reasoning(abstract)
AI总结 该研究提出ISAC框架,将代码差异与问题信息结合作为LLM输入生成提交消息,经实验验证其性能优于现有基线,且纳入问题信息可提升CMG效果。
Comments 28 pages, 7 images, 11 tables, Manuscript submitted to a journal (2026)
语言训练深度伪造检测器的正则化能力
机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。
FlexAI: 一种多模态解决方案,用于提供个性化和自适应的健身干预
专题命中 推理评测 :reasoning(abstract)
AI总结 FlexAI通过整合计算机视觉、生理传感器和大语言模型,提供实时个性化健身指导,显著提升用户参与度和效果。
运行时增强的LLM用于ML笔记本的崩溃检测与诊断
专题命中 推理评测 :reasoning(abstract)
AI总结 CRANE-LLM通过整合运行时信息提升ML笔记本崩溃检测与诊断的准确性与F1分数。
LAGEA:基于语言引导的机器人操作代理
机构 * Department of Robotics ; Mechatronics Engineering, University of Dhaka, Bangladesh ; Center for Computational \& Data Sciences, Independent University, Bangladesh
专题命中 推理评测 :reasoning(abstract)
AI总结 LAGEA通过语言引导具身代理学习,提升机器人操作任务的成功率和效率。
Comments ICML 2026 Main Track Poster
仅掩码不足:面向医疗AI的多模态去标识化生成式修复
机构 * Kennesaw State University(肯尼索州立大学) ; Miami University(迈阿密大学) ; Georgia State University(佐治亚州立大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对医疗图像-文本数据的PHI泄漏问题,提出端到端多模态净化框架ClinX,结合图像侧生成式修复与文本侧渐进式去标识化,在MedVQA中验证其优于仅OCR掩码的性能。
基于商业自动语音识别和多模态大语言模型的口吃语音零样本识别
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究评估了商业ASR和MLLM在口吃语音识别中的性能,发现GPT-4o在重度口吃情况下显著降低WER,而Gemini变体表现下降,为辅助语音接口技术选择提供实证依据。
Comments 32 pages. Revised peer-reviewed version. Updated dataset filtering and transcript normalization, expanded four-condition prompting ablation and error analysis, and revised statistical reporting. Published in International Journal of Intelligent Systems
Journal ref International Journal of Intelligent Systems, 2026; 2026:6065038
基于经验证的LLM推断依赖关系与响应驱动优化的REST API测试
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出APIPilot框架,通过执行验证LLM推断的REST API依赖关系,结合响应驱动优化,在16个真实API上实现高覆盖率与成功率,优于现有基线。
Comments Under review