arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Stanford University(斯坦福大学)

2026-03-17 至 2026-03-17 共收录 6
2603.15483 2026-03-17 cs.AI

Talk, Evaluate, Diagnose: User-aware Agent Evaluation with Automated Error Analysis

谈话、评估、诊断:基于用户意识的代理评估与自动错误分析

Penny Chong, Harshavardhan Abichandani, Jiyuan Shen, Atin Ghosh, Min Pyae Moe, Yifan Mai, Daniel Dahlmeier

机构 * SAP Stanford University(斯坦福大学)

AI总结 本文提出TED框架,通过用户角色模板、自动评分和错误分析,提升代理评估的全面性与效率,实验显示在模型和用户水平上取得8-10%的性能提升。

Comments Accepted as a conference paper at ICLR 2026. Code and dataset are available in the repository https://github.com/SAP-samples/agent-quality-inspect

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14833 2026-03-17 cs.LG cs.AI

Ablate and Rescue: A Causal Analysis of Residual Stream Hyper-Connections

消除与救援:残差流超连接的因果分析

William Peng, Josheev Rai, Kevin Tseng, Siwei Wang, Sean Wu

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Independent(独立) University of Oxford(牛津大学)

AI总结 本文提出首个开源mHC语言模型,通过代表层面指标和因果干预分析多流架构,揭示并行流的信息编码与利用机制,引入系统性的流消除-救援框架进行因果比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13660 2026-03-17 cs.CV

Learning Generalizable 3D Medical Image Representations from Mask-Guided Self-Supervision

从掩码引导自监督学习中学习通用的3D医学图像表示

Yunhe Gao, Yabin Zhang, Chong Wang, Jiaming Liu, Maya Varma, Jean-Benoit Delbrouck, Akshay Chaudhari, Curtis Langlotz

机构 * Stanford University(斯坦福大学)

AI总结 本文提出MASS方法,通过掩码引导自监督学习,学习通用的医学图像表示,实现了在不同数据集上的高效分割和分类任务。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13362 2026-03-17 cs.SD cs.AI eess.AS

Patient-Level Multimodal Question Answering from Multi-Site Auscultation Recordings

多站点听诊录音的患者级多模态问答

Fan Wu, Tsai-Ning Wang, Nicolas Zumarraga, Ning Wang, Markus Kreft, Kevin O'Sullivan, Elgar Fleisch, Oliver Aalami, Paul Schmiedmayer, Robert Jakob, Patrick Langer

机构 * Agentic Systems Lab, ETH Zurich(伦理学院系统实验室,苏黎世联邦理工学院) Eindhoven University of Technology(埃因霍温理工大学) Centre for Digital Health Interventions, ETH Zurich(数字健康干预中心,苏黎世联邦理工学院) Centre for Digital Health Interventions, University of St. Gallen(数字健康干预中心,圣加尔登大学) Stanford Mussallem Center for Biodesign, Stanford University(斯坦福穆萨勒姆生物设计中心,斯坦福大学)

AI总结 本文提出通过门控交叉注意力将多站点听诊录音与冻结的大语言模型嵌入空间对齐,实现患者级评估,在CaReSound基准上取得SOTA结果,展示轻量领域特定编码器与多站点聚合的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13284 2026-03-17 cs.LG stat.ML

Do Diffusion Models Dream of Electric Planes? Discrete and Continuous Simulation-Based Inference for Aircraft Design

扩散模型是否梦想着电动飞机?基于模拟的推断用于飞机设计

Aurelien Ghiglino, Daniel Elenius, Anirban Roy, Ramneet Kaur, Manoj Acharya, Colin Samplawski, Brian Matejek, Susmit Jha, Juan Alonso, Adam Cobb

机构 * Computer Science Laboratory, SRI(SRI计算机科学实验室) Aerospace Design Laboratory, Stanford University(斯坦福大学航空航天设计实验室)

AI总结 本文基于模拟推断方法,生成电动垂直起降飞机的概念设计,引入两级概率模型,结合扩散模型加速设计生成并发现飞机设计中的物理规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07976 2026-03-17 cs.RO cs.CV

VLD: Visual Language Goal Distance for Reinforcement Learning Navigation

VLD:用于强化学习导航的视觉语言目标距离

Lazar Milikic, Manthan Patel, Jonas Frey

机构 * ETH Zurich(苏黎世联邦理工学院) EPFL(瑞士联邦理工学院) Stanford University(斯坦福大学) UC Berkeley(伯克利大学)

AI总结 本文提出VLD学习框架,通过解耦感知学习与策略学习,利用大规模视频数据训练距离预测器,提升机器人导航性能与现实迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏