arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-02-18 至 2026-02-18 共收录 7
2602.15730 2026-02-18 cs.CL econ.EM

Causal Effect Estimation with Latent Textual Treatments

利用潜在文本干预进行因果效应估计

Omri Feldman, Amar Venugopal, Jann Spiess, Amir Feder

机构 * School of Computer Science and Engineering, The Hebrew University of Jerusalem(计算机科学与工程学院,特拉维夫大学) Department of Economics, Stanford University(斯坦福大学经济系) Graduate School of Business, Stanford University(斯坦福大学商学院)

AI总结 本文提出了一种端到端流程,通过稀疏自编码器生成假设并引导,结合协变量残差化方法,解决文本作为治疗实验中的因果效应估计问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15812 2026-02-18 cs.AI cs.CL

ErrorMap and ErrorAtlas: Charting the Failure Landscape of Large Language Models

误差图与误差图谱:大型语言模型失败景观的绘制

Shir Ashury-Tahan, Yifan Mai, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen

机构 * IBM Research(IBM研究院) Stanford University(斯坦福大学) MIT(麻省理工学院)

AI总结 ErrorMap和ErrorAtlas通过分析LLM失败原因,揭示模型弱点,为模型改进和评估提供更深入的洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19412 2026-02-18 cs.CL

The Mighty ToRR: A Benchmark for Table Reasoning and Robustness

强大的ToRR:表格推理与鲁棒性基准

Shir Ashury-Tahan, Yifan Mai, Rajmohan C, Ariel Gera, Yotam Perlitz, Asaf Yehudai, Elron Bandel, Leshem Choshen, Eyal Shnarch, Percy Liang, Michal Shmueli-Scheuer

机构 * IBM Research(IBM研究院) Bar-Ilan University(巴伊兰大学) Stanford University(斯坦福大学) MIT(麻省理工学院)

AI总结 ToRR基准通过评估模型在不同表格格式和提示下的表现,揭示了表格推理任务中模型的鲁棒性问题,强调多格式测试对评估模型能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12249 2026-02-18 cs.AI cs.CL cs.CY

"Sorry, I Didn't Catch That": How Speech Models Miss What Matters Most

对不起,我没听清那个:语音模型忽视最关键的东西

Kaitlyn Zhou, Martijn Bartelds, Federico Bianchi, James Zou

机构 * TogetherAI Cornell University(康奈尔大学) Stanford University(斯坦福大学)

AI总结 该研究发现语音模型在现实应用中对高风险短语音转录存在显著误差,通过合成数据生成方法显著提升了非英语主要说话人的转录准确性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03820 2026-02-18 cs.RO cs.MA cs.SY eess.SY

Satellite Autonomous Clock Fault Monitoring with Inter-Satellite Ranges Using Euclidean Distance Matrices

利用欧几里得距离矩阵的卫星自主钟故障监测(基于星间距离)

Keidai Iiyama, Daniel Neamati, Grace Gao

机构 * Department of Aeronautics and Astronautics, Stanford University, California, United States(航空与航天系,斯坦福大学,加州,美国)

AI总结 本文提出利用欧几里得距离矩阵检测卫星钟故障的方法,适用于月球卫星网络,无需先验知识,通过奇异值监测实现故障识别。

Comments This manuscript was submitted to the NAVIGATION: Journal of the Institute of Navigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15206 2026-02-18 cs.LG cs.CC

How Global Calibration Strengthens Multiaccuracy

如何全局校准增强多准确性

Sílvia Casacuberta, Parikshit Gopalan, Varun Kanade, Omer Reingold

机构 * University of Oxford(牛津大学) Apple(苹果公司) Stanford University(斯坦福大学)

AI总结 本文研究了多准确性作为学习原语的威力,发现其本身较弱,但结合全局校准后能显著提升,恢复了多校准下的推论。

Comments Presented at FOCS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16051 2026-02-18 cs.CL

Moving Beyond Medical Exams: A Clinician-Annotated Fairness Dataset of Real-World Tasks and Ambiguity in Mental Healthcare

超越医学考试:一个由临床专家标注的现实任务及精神卫生领域模糊性公平性数据集

Max Lamparth, Declan Grabb, Amy Franks, Scott Gershan, Kaitlyn N. Kunstman, Aaron Lulla, Monika Drummond Roots, Manu Sharma, Aryan Shrivastava, Nina Vasan, Colleen Waickman

机构 * Stanford University(斯坦福大学) University of Colorado(科罗拉多大学) Northwestern University(西北大学) University of Wisconsin(威斯康星大学) Yale School of Medicine(耶鲁医学院) University of Chicago(芝加哥大学) Ohio State University(俄亥俄州立大学)

AI总结 本文提出一个由临床专家标注的现实任务公平性数据集,用于评估模型在精神卫生领域决策中的性能和偏见问题。

Comments Camera-ready version for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏