arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-08-26 至 2026-08-26 共收录 10
2608.24876 2026-08-26 cs.AI cs.CL 新提交

Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses

面向长 horizon 智能体利用的递归经验-工作记忆演化

Zhaochen Yu, Yingcheng Wu, Zhenfei Yin, Kaiyuan Chen, Zhe Zhao, Mengdi Wang, Shuicheng Yan, Ling Yang

机构 * Princeton University(普林斯顿大学) Stanford University(斯坦福大学) University of Oxford(牛津大学)

AI总结 针对长 horizon 智能体的递归自我改进难题,提出 Recuris 架构,通过递归记忆演化提升任务成功率,在多个基准和模型上实现显著性能提升,为 RSI 提供可扩展基础。

Comments Code: this https URL (https://github.com/Gen-Verse/Recuris)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24858 2026-08-26 cs.LG stat.ML 新提交

Bellman Calibration for Marginalized Importance Weighting in Offline Reinforcement Learning

离线强化学习中边缘化重要性加权的贝尔曼校准

Lars van der Laan, Nathan Kallus

机构 * Stanford University(斯坦福大学) Netflix(网飞) Cornell University(康奈尔大学)

AI总结 本文针对离线强化学习中边缘化重要性加权的残留占用平衡违反问题,提出等渗贝尔曼校准方法,可减少此类违反并保证下游策略价值估计等任务的性能。

Comments 43 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24724 2026-08-26 cs.RO 新提交

Fiber Bragg Grating Whiskers for Bioinspired Hydrodynamic Perception on Underwater Robots

用于水下机器人生物启发式流体动力感知的光纤布拉格光栅触须

Hao Li, Tianyu Tu, Siyue Yao, Ziyang Chang, Juhyun Jung, Xiaochi Xie, Long Yin Chung, Tian-Ao Ren, Genliang Chen, Mark Cutkosky

机构 * Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 受港海豹触须流体感知能力启发,研发光纤布拉格光栅触须并验证其可辅助水下机器人仅通过触须信号区分直行与转弯,正确率达85%,为水下机器人流体感知提供新方案。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24101 2026-08-26 cs.RO 新提交

TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks

TrAct:通过视觉轨迹连接机器人控制与视觉预测

Zhi Cao, Howard Ji, Kevin Zhang, Kuangzhi Ge, Li Fei-Fei, Jiajun Wu, Huang Huang

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学)

AI总结 TrAct是基于世界模型的机器人决策框架,以视觉轨迹为控制与预测的中间接口,在LIBERO-INTEGRAL基准和Franka任务上,相较基线π₀.5显著提升了操作成功率与视频预测质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23780 2026-08-26 cs.CL cs.AI cs.HC 新提交

When Youth Enter The Chat: An Epistemic Shift in the Validation of LLM-Based Measures of Student Talk

当青少年参与对话:基于大语言模型(LLM)的学生话语测量验证中的认知转变

Liliana Santos-Deonizio, James Malamut, Ramón Martínez, Dorottya Demszky

机构 * Stanford University(斯坦福大学)

AI总结 该研究针对基于LLM的学生话语测量的认知排斥问题,通过多民族志方法让青少年参与研究,发现学生解读与LLM测量存在不一致,凸显青少年参与认知过程的必要性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23568 2026-08-26 cs.AI 新提交

RENDER: Controlling Reader-Facing Evidence in LLM Memory Evaluation

RENDER:控制LLM记忆评估中面向读者的证据

Yuan Si, Simeng Han, Daming Li, Jialu Zhang

机构 * University of Waterloo(滑铁卢大学) Stanford University(斯坦福大学)

AI总结 RENDER是控制LLM记忆评估中面向读者证据的基准,实验显示其相关数据包比原始对话表现更优,效果可迁移,提示需关注评估中的读者面向人工制品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20373 2026-08-26 cs.CL 版本更新

An ambiguity taxonomy for evaluating large language model performance on clinical registry abstraction: a multi-site prospective study

用于评估大型语言模型在临床登记处抽象任务中性能的歧义分类:一项多中心前瞻性研究

James Matheson, Betsy Castillo, Andrew Y. Shin, David Scheinker

机构 * Carta Healthcare(卡塔医疗) Stanford University School of Medicine(斯坦福大学医学院)

AI总结 本多中心前瞻性研究评估LLM在临床登记处抽象任务中的性能,发现其准确率远低于人类抽象人员,且随问题歧义度和临床推理要求升高而降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16645 2026-08-26 cs.AI cs.CL cs.MA 版本更新

Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies

重构:从预发表参考文献中恢复研究思路的盲基准

Shaolong Chen, Yanlin Fei, Nazhou Liu, Xinmiao Yu, Lei Li, Rahul Thapa, Madalina Ciobanu, Navan Preet Singh, Qingqing Mao, Ritankar Das

机构 * Stanford University(斯坦福大学) Titan Holdings(泰坦控股公司) Prentis AI(普伦蒂斯人工智能公司)

AI总结 该研究提出Reconstruction盲基准,测试语言模型从预发表参考文献恢复论文思路的能力,发现多智能体流水线可将匹配率提升约2.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18467 2026-08-26 cs.LG 版本更新

Weak-to-Strong Learning in Decision Making

决策中的弱到强学习

Jingwei Ji, Renyuan Xu

机构 * Stanford University(斯坦福大学)

AI总结 针对运营决策中预测模型训练的数据不对称问题,提出决策感知弱到强(W2S)框架,利用有标签和无标签数据训练模型,建立相关风险上下界得出性能改善条件,通过实验验证理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16654 2026-08-26 cs.CL cs.AI cs.LG 版本更新

Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models

Omanic:迈向大语言模型多跳推理的逐步评估

Xiaojie Gu, Sherry T. Tong, Aosong Feng, Sophia Simeng Han, Jinghui Lu, Yingjian Chen, Yusuke Iwasawa, Yutaka Matsuo, Chanjun Park, Rex Ying, Irene Li

机构 * The University of Tokyo(东京大学) Yale University(耶鲁大学) Stanford University(斯坦福大学) Xiaomi EV(小米EV) Soongsil University(顺天大学)

AI总结 针对大语言模型在多跳问答中中间步骤推理失败难以诊断的问题,提出Omanic基准,通过分解为单跳子问题并分析步骤级错误,揭示后期跳数瓶颈、事实知识下限和错误传播,微调后提升多个推理基准性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏