Automated QoR improvement in OpenROAD with coding agents
在OpenROAD中通过编码代理实现自动化QoR提升
机构 * UC San Diego(UC圣地亚哥大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 AuDoPEDA通过自主编码代理在OpenROAD中实现EDA技术的自动化改进,显著提升QoR指标。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
在OpenROAD中通过编码代理实现自动化QoR提升
机构 * UC San Diego(UC圣地亚哥大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 AuDoPEDA通过自主编码代理在OpenROAD中实现EDA技术的自动化改进,显著提升QoR指标。
PersonaX: 多模态数据集与LLM推断行为特征
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California San Diego(加州大学圣地亚哥分校) ; Australian National University(澳大利亚国立大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 PersonaX通过多模态数据集结合LLM推断行为特征,推动多模态特征分析与因果推理发展。
Comments ICLR 2026
MAPS: 一种多语言评估基准,用于代理性能和安全
机构 * Fujitsu Research of Europe(富士通欧洲研究部) ; Fujitsu Limited(富士通有限公司) ; Cohere
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 MAPS是一个多语言评估基准,用于评估代理AI在不同语言和任务中的性能与安全性。
Comments Accepted to EACL 2026 findings
Massive-STEPS: 用于理解POI签到的大量语义轨迹 -- 数据集和基准测试
机构 * University of New South Wales(新南威尔士大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 推理评测 :planning(abstract);分类 cs.LG
AI总结 Massive-STEPS通过提供大规模、公开的POI签到数据集和基准测试,推动人类移动性和POI轨迹建模的可重复研究。
行为树在机器人中的辅助编程接口设计与评估
专题命中 推理评测 :planning(abstract)
AI总结 本文提出BETR-GUI,结合AI助手与拖放编辑器,通过整合多种技术提升机器人行为树编程效率,实验证明人类用户优于纯AI助手。
超越文本到SQL:基于DAR的自主研究驱动数据库探索
专题命中 推理评测 :reasoning(abstract)
AI总结 DAR是一种多代理系统,通过自主探索数据完成端到端数据库研究,显著提升分析效率并生成基于证据的洞察。
推动大语言模型推理边界的 nudging
机构 * Salesforce AI Research(Salesforce AI研究)
专题命中 其他推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.LG
AI总结 NuRL通过自动生成提示提升大语言模型推理上限,解决传统RL无法学习无法解决样本的问题。
Comments ICLR 2026 (Camera-Ready)
解耦推理与隐式事实标记(DRIFT):一种双模型框架,用于高效长上下文推理
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Tongji University(同济大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 DRIFT通过双模型框架解耦知识提取与推理,提升长上下文推理效率和准确性。
ESTAR: 早期停止的令牌感知推理用于高效推理
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Optum AI
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 ESTAR通过令牌感知推理的早期停止机制,有效减少推理冗余,提升大型推理模型的推理效率,同时保持高准确性。
大语言模型推理可预测模型何时正确:来自编程课堂对话的证据
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本研究通过分析课堂对话中的教师发言,发现LLM生成的推理能有效预测模型预测的正确性,使用随机森林分类器达到F1得分0.83,表明基于推理的错误检测在教育对话分析中具有实用价值。
DREAM:面向高效自主水下监测的领域感知方法
机构 * Electrical Engineering, University of South Florida(佛罗里达州立大学电气工程系) ; Maryland Robotics Center (MRC), University of Maryland(马里兰大学机器人中心) ; Woods Hole Oceanographic Institution (WHOI)(伍兹霍尔海洋研究所) ; Mechanical Engineering, University of Delaware(德雷克塞尔大学机械工程系)
专题命中 其他推理 :reasoning(title);分类 cs.AI
AI总结 DREAM通过视觉语言模型引导的自主框架,实现了高效、低耗的水下长期监测,显著提升了目标物体探测效率与覆盖范围。
Comments In Proceeding of ICRA 2026
超越均匀信用:为策略优化的因果信用分配
机构 * Lexsi Labs(Lexsi实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出反事实重要性加权方法,通过因果信用分配提升语言模型推理性能,无需辅助模型或外部标注,实验验证其在GSM8K上的有效性。
Comments 12 pages, 1 figure
循环变换器中逐步数据归因
机构 * Hasso Plattner Institute for Digital Engineering, University of Potsdam(波恩大学数字工程研究所) ; Technical University of Munich(慕尼黑技术大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Harvard University(哈佛大学) ; Imperial College London(伦敦帝国理工学院) ; Google DeepMind(谷歌DeepMind)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SDI方法,用于分析循环变换器中每个循环步骤对模型的影响,提升数据归因和可解释性能力。
路由、级联与用户选择用于大语言模型
机构 * University of Ottawa(渥太华大学) ; NVIDIA(NVIDIA公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了大语言模型路由策略与用户行为之间的博弈,揭示了提供者与用户在效用和成本排序上的不一致,提出了基于Stackelberg博弈的路由优化方法,并得出了单用户单提供者互动的阈值规则。
Comments 23 pages, accepted in ICLR 2026
合同型深度伪造:大语言模型能生成合同吗?
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文指出大语言模型生成的合同可能不具法律效力,质疑其在法律领域应用的可行性。
Comments Accepted for publication
TwinWeaver: 一种基于大语言模型的跨癌症数字双胞胎基础模型框架
机构 * Computational Sciences Center of Excellence, Roche, Penzberg, Germany(罗氏计算科学卓越中心) ; Computational Health Center, Helmholtz Munich, Munich, Germany(海德堡慕尼黑计算健康中心) ; Department of Biology, Ludwig Maximilian University of Munich, Munich, Germany(慕尼黑路易斯·马克西米利安大学生物学系) ; Early Development Oncology, Roche Innovation Center Zurich, Roche, Schlieren, Switzerland(罗氏苏黎世创新中心早期肿瘤学) ; Computational Sciences Center of Excellence, Genentech, New York City, USA(基因泰克计算科学卓越中心) ; Computational Sciences Center of Excellence, Genentech, South San Francisco, USA(基因泰克计算科学卓越中心) ; Center for Data Science, New York University, New York City, USA(纽约大学数据科学中心) ; Department of Computer Science, Stanford University, Stanford, CA, USA(斯坦福大学计算机科学系) ; Computational Sciences Center of Excellence, Roche, Basel, Switzerland(罗氏巴塞尔计算科学卓越中心) ; Department of Biochemistry(生物化学系) ; Biotechnology Institute, The University of Melbourne, Melbourne, Australia(墨尔本大学生物技术研究所)
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 TwinWeaver通过基于大语言模型的框架,构建跨癌症数字双胞胎,提升临床事件预测与风险分层精度。
VersaViT: 通过任务引导优化增强MLLM视觉骨干
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院) ; CMIC, Shanghai Jiao Tong University, China(上海交通大学计算机学院) ; WeChat AI, Tencent Inc., China(腾讯公司)
专题命中 其他推理 :reasoning(abstract)
AI总结 VersaViT通过任务引导优化增强MLLM视觉骨干,解决其在密集预测任务中的性能问题,提升视觉任务的适应性与表现。
无需训练的多模态仇恨定位与大型语言模型
机构 * Hybrid Intelligence Lab, University of Durham(杜伦大学混合智能实验室) ; Multimodal Intelligence Lab, University of Exeter(埃克塞特大学多模态智能实验室) ; The MIx Group University of Birmingham(伯明翰大学MIx集团)
专题命中 其他推理 :reasoning(abstract)
AI总结 提出无需训练的多模态仇恨视频定位框架LELA,通过多阶段提示方案和跨模态推理机制实现高精度定位。