arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Washington(华盛顿大学)

共收录 1957
2609.04141 2026-09-04 cs.AI 新提交

Efficient Test-Time Adaptation through Human-AI Interaction

通过人机交互实现高效的测试时自适应

Zora Zhiruo Wang, Apurva Gandhi, Rulin Shao, Aspen Chen, Jonas Mueller, Zhiqi Liang, Jett Chen, Michael Ryan, Qianou Ma, Luxi He, Zhoujun Cheng, Andre He, Seungone Kim, Jiayi Geng, Mingqian Zheng, Weiwei Sun, Zheyuan Zhang, Xinran Zhao, Yike Wang, Abe Hou, Liwei Jiang, Pang Wei Koh, Diyi Yang, Graham Neubig, Daniel Fried

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学) Handshake AI(汉德shake人工智能公司) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

AI总结 本研究提出TAHI方法,通过人机交互将跨会话信号整合到智能体中,针对30位用户的600项任务自适应后,单独任务成功率提升4.5-20.9%,还可跨用户提升最高8.8%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03180 2026-09-04 cs.LG 新提交

Portable Causal Fairness Across Synthetic Data Generator Families

跨合成数据生成器族的便携式因果公平性

Steven Golob, Sikha Pentyala, Martine De Cock

机构 * University of Washington Tacoma(华盛顿大学塔科马分校)

AI总结 本研究将三种公平性定义迁移至多类合成数据生成器,验证了其通用性,提出的因果扩散主干生成公平性最优的合成数据,且对保真度影响极小,添加隐私保证不损害公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30076 2026-09-04 cs.CL 版本更新

Budget-Aware Compression Pipeline for Single-GPU LLM Inference: Methods, Trade-offs, and Coupling Effects

面向单GPU大语言模型推理的预算感知压缩流水线:方法、权衡与耦合效应

Hongyu Yu, Yifei Shen

机构 * Lenovo Research(联想研究院) University of Washington(华盛顿大学)

AI总结 该研究针对单GPU部署70B参数大语言模型的内存、吞吐量及集成成本问题,构建了含剪枝、量化、KV缓存压缩的预算感知压缩流水线,实现了模型压缩至33GB、57 tokens/s推理速度且精度损失在5%内的效果,提供了设计规则与评估协议。

Comments Withdrawn because the submission was made without the required authorization from a co-author for public disclosure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22376 2026-09-04 cs.CV 版本更新

FlexMap: Robust HD Map Construction under Flexible Camera Configurations

FlexMap:从灵活的相机配置构建通用HD地图

Run Wang, Chaoyi Zhou, Amir Salarpour, Xi Liu, Zhi-Qi Cheng, Feng Luo, Mert D. Pesé, Siyu Huang

机构 * School of Computing, Clemson University School of Engineering \& Technology, University of Washington

AI总结 FlexMap通过几何感知基础模型和跨帧注意力机制,实现从灵活相机配置构建通用HD地图,提升了自动驾驶系统在传感器失效和配置变化时的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04736 2026-09-04 cs.CL 版本更新

Towards Multi-modal Multi-turn Safety: From Agentic Interaction to Strategic Alignment

AM$^3$Safety: 向多模态多轮安全对齐的数据高效方法

Han Zhu, Jiale Chen, Chengkun Cai, Shengjie Sun, Haoran Li, Yujin Zhou, Chi-Min Chan, Pengcheng Wen, Lei Li, Yike Guo, Sirui Han

机构 * Hong Kong University of Science and Technology(香港科技大学) Zhongshan School of Medicine, SUN YAT-SEN UNIVERSITY(中山医学院,孙中山大学) University of Edinburgh(爱丁堡大学) University of Washington(华盛顿大学)

AI总结 AM$^3$Safety通过结合冷启动拒绝阶段和组相对策略优化,有效提升多模态多轮对话的安全性,降低攻击成功率并增强模型的无害与帮助维度。

Comments EMNLP Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16185 2026-09-04 stat.ML cs.LG

Behavior of prediction performance metrics with rare events

Emily Minus, R. Yates Coley, Susan M. Shortreed, Brian D. Williamson

机构 * Department of Biostatistics, University of Washington(华盛顿大学生物统计学系) Biostatistics Division, Kaiser Permanente Washington Health Research Institute(凯撒医疗集团华盛顿健康研究中心生物统计学部) Vaccine and Infectious Disease Division, Fred Hutchinson Cancer Center(弗雷德 Hutchinson癌症中心疫苗与传染病部)

Comments Accepted for publication in the Journal of Clinical Epidemiology. 51 pages (16 main, 35 supplementary), 26 tables (3 main, 23 supplementary), 6 figures (4 main, 2 supplementary)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03096 2026-09-03 cs.LG cs.CL 版本更新

When Prompts Interact: Assessing Prompt Arithmetic for Deconfounding under Distribution Shift

提示词交互时:评估分布偏移下用于去混淆的提示词算术

Zhecheng Sheng, Yongsen Tan, Xiruo Ding, Trevor Cohen, Serguei Pakhomov

机构 * University of Minnesota(明尼苏达大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 本研究提出混合提示词算术(HyPA),结合任务提示词与线性化混淆提示词,在多个基准测试中改善分布偏移下的鲁棒性-性能权衡,为提升混淆偏移下的模型鲁棒性提供了参数高效的方法。

Comments 20 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02270 2026-09-03 cs.RO cs.AI 新提交

CrashDiffuser: VLM-Guided Collision Intent Reasoning for Fine-Grained Safety-Critical Traffic Scenario Generation

CrashDiffuser:VLM引导的碰撞意图推理用于细粒度安全关键交通场景生成

Shucheng Zhang, Yuang Zhang, Bingzhang Wang, Muhammad Monjurul Karim, Kehua Chen, Yinhai Wang

机构 * University of Washington(华盛顿大学)

AI总结 CrashDiffuser是一种闭环VLM引导的扩散框架,通过分层碰撞意图接口解耦语义碰撞推理与轨迹合成,在WOMD场景上实现了较高的目标碰撞率和接触区域控制成功率,可用于细粒度安全关键交通场景生成以评估自动驾驶系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19539 2026-09-03 cs.CL cs.AI 版本更新

FDARxBench: Benchmarking Regulatory and Clinical Reasoning on FDA Generic Drug Assessment

FDARxBench:基于FDA通用药物评估的监管与临床推理基准测试

Betty Xiong, Jillian Fisher, Benjamin Newman, Meng Hu, Shivangi Gupta, Yejin Choi, Lanyan Fang, Russ B Altman

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) U.S. Food and Drug Administration(美国食品药品监督管理局)

AI总结 本文提出FDARxBench基准测试,用于评估基于文档的问答任务,通过FDA药物标签文档生成高质量问答示例,揭示语言模型在事实基础、长上下文检索和安全拒绝行为方面的差距。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01532 2026-09-02 cs.CL 新提交

Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall

训练中期的知识蒸馏更利于推理而非事实回忆

Jacqueline He, Howard Yen, Shuyue Stella Li, Margaret Li, Hanqing Zeng, Yinglong Xia, Benyu Zhang, Zhuokai Zhao, Qiang Zhang, Pang Wei Koh, Luke Zettlemoyer, Wen-tau Yih

机构 * Meta AI University of Washington(华盛顿大学) Princeton University(普林斯顿大学)

AI总结 该研究发现训练中期的前向KD会减缓事实回忆但提升推理,提出Switch Distillation方法,在保留高推理和知识性能的同时维持大部分事实回忆,优于现有蒸馏目标。

Comments 33 pages, 13 figures, 9 tables. Code is publicly available at https://github.com/facebookresearch/midtraining-distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00546 2026-09-02 cs.SE cs.AI 新提交

Runtime-Independent Persistent Agents: Preserving Identity, Memory, and Code Across Models, Harnesses, and Servers

与运行时无关的持久智能体:跨模型、编排器和服务器保留身份、记忆与代码

Zhenyu Zhao, Roy Zhao

机构 * University of Washington(华盛顿大学) Paul G. Allen School of Computer Science & Engineering(保罗·G·艾伦计算机科学与工程学院)

AI总结 该研究提出与运行时无关的持久智能体架构,定义连续性不变量与相关协议,通过 Enoch 实现该设计,验证其可跨模型等变更保留智能体连续性。

Comments 8 pages, 2 figures, 3 tables. Reference implementation and artifacts: https://github.com/our-ark/enoch

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00508 2026-09-02 cs.AI 新提交

CoVer: Conflict-Aware Claim Verification

CoVer:感知冲突的主张验证

Shuning Zhang, Dai Shi, Bohao Chu, Hui Wang, Yuwei Chuai, Yifan Wang, Jingruo Chen, Simin Li, Xin Yi, Hewu Li

机构 * Tsinghua University(清华大学) Tongji University(同济大学) University of Duisburg-Essen(杜伊斯堡-埃森大学) University of Luxembourg(卢森堡大学) University of Washington(华盛顿大学) Cornell University(康奈尔大学) Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 针对社交媒体事实核查的证据级与聚合级冲突挑战,提出大规模数据集ContraNote及三阶段裁决框架CoVer,在多数据集上实现了优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26872 2026-09-02 cs.LG cs.AI cs.CL 版本更新

When the Strongest Teacher Is Not the Best Teacher: Student-Centric Answer Selection

最强的教师并不总是最好的教师:以学生为中心的答案选择

Zhengyu Hu, Zheyuan Xiao, Linxin Song, Fengqing Jiang, Yuetai Li, Zhihan Xiong, Yue Liu, Junhao Lin, Yao Su, Lijie Hu, Kaize Ding, Teng Xiao, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Southern California(南加州大学) Independent Researcher(独立研究者) National University of Singapore(新加坡国立大学) Microsoft(微软) Google(谷歌) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Northwestern University(西北大学) Allen Institute for AI (AI2)(人工智能研究院(AI2))

AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26797 2026-09-02 cs.LG cs.CL 版本更新

Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior

潜在循环Transformer:架构探索、训练策略与扩展行为

Zeyi Huang, Xuehai He, LiLiang Ren, Yiping Wang, Baolin Peng, Hao Cheng, Shuohang Wang, Pengcheng He, Jianfeng Gao, Yong Jae Lee, Yelong Shen

机构 * Microsoft(微软公司) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学)

AI总结 提出潜在循环Transformer(LRT),通过跨层循环潜在路径重用前一token的高层隐藏状态作为记忆,在不增加暂停token或额外深度循环的情况下,以约2倍基线计算实现并行训练,在匹配有效计算下提升语言建模损失和上下文学习能力,仅增加0.3%参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30502 2026-09-01 cs.LG stat.ME stat.ML 新提交

When the Martingale Never Stops Firing: Anytime-Valid Gating on Real Forecast Streams

当鞅永不停止触发:真实预测流上的任意时刻有效门控机制

Weijia Han, Lisha Qu

机构 * University of Washington(华盛顿大学)

AI总结 本研究针对真实预测流场景,测试了任意时刻有效门控机制在修正时间序列基础模型时的有效性,发现其在真实流上触发异常,采用Huber式门控可显著降低退化,建议相关方法附带空校准控制。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29988 2026-09-01 cs.AI 新提交

AutoCRAT: Within-trajectory Joint Control of Stochasticity and Compute for LLM Reasoning

AutoCRAT:针对大语言模型推理的轨迹内随机性与计算量联合控制

Hanjun Luo, Qiushi Liu, Jingya Zhang, Haihong Pang, Jiaheng Wen, Yifei Ma, Yu Yao, Chengxi Zhang, Hanrong Zhang, Yankai Chen, Hanan Salam

机构 * New York University(纽约大学) New York University Abu Dhabi(纽约大学阿布扎比分校) University of Washington Seattle(华盛顿大学西雅图分校) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 AutoCRAT是针对大语言模型推理的轨迹内随机性与计算量联合控制方法,仅在语义边界更新决策,在6个基准上减少推理令牌并提升准确率,且跨主干迁移性强。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29489 2026-09-01 cs.CR cs.CV 新提交

SpatialTrust: A Benchmark for Environmental Risk Recognition in Secure Authentication

SpatialTrust:安全认证中环境风险识别的基准测试

Junbin Lu, Hsiang-Wei Huang, Saesha Wadhwa, Yu Ting Hsu, Jenq-Neng Hwang

机构 * University of Washington(华盛顿大学)

AI总结 本文提出SpatialTrust基准测试评估MLLM在安全认证场景中环境风险识别等五项能力,发现现有模型表现有限,还引入SpatialTrustGuard流程提升了Qwen3-VL-30B-A3B-Instruct的性能。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28837 2026-09-01 cs.HC cs.AI 新提交

Delegating Before Learning: Where Generative AI Sits in Students' Professional Communication

学习前的委托:生成式AI在学生专业沟通中的定位

Jared Ren, Soobin Cho

机构 * University of Washington(华盛顿大学)

AI总结 本研究通过访谈12名学生,探究生成式AI在学生专业沟通中的应用,对比AI中介与无辅助写作模型的差异,指出个人能力无法形成、沟通真实性与信任成负担等风险,呼吁研究与政策关注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28609 2026-09-01 cs.CL cs.AI cs.CV 新提交

Parametric Multimodal User Memory: Storing What Captions Cannot Carry

参数化多模态用户记忆:存储字幕无法承载的内容

Bojie Li, Noah Shi

机构 * Pine AI(派恩人工智能) University of Washington(华盛顿大学)

AI总结 该研究提出参数化多模态用户记忆,结合视觉语言模型与专用编码器,解决传统文本用户记忆丢失感知信息的问题,在PerceptMem数据集上验证了其有效性与可推广性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29266 2026-09-01 physics.soc-ph cs.AI 新提交

Measurement Validity in LLM Cultural Alignment

大语言模型文化对齐中的测量有效性

An Duy Nguyen, Muhammad Aurangzeb Ahmad

机构 * University of Washington(华盛顿大学) University of Washington Bothell(华盛顿大学 Bothell 分校)

AI总结 本研究针对多个LLM区分调查回复、采样噪声与问题框架,发现多数模型的表观文化位置无法与噪声区分,提示需先验证测量可靠性才能将LLM调查回复用于文化归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24949 2026-09-01 cs.LG cs.AI cs.CL 版本更新

Demystifying Reinforcement Learning Post-Training of Language Models

揭秘语言模型的强化学习后训练

Donovan Clay, Saket Gollapudi, Sankar Harilal, Min Jang, Jacob Morrison, Sewoong Oh, Natasha Jaques

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

AI总结 本研究拆解语言模型的RL后训练算法,探究各因素对其结果的影响,为NLP领域人员提供RL后训练的入门指南。

Comments Link to website: https://minjang10.github.io/demystifying-rl-finetuning-web Link to code: https://github.com/sankarh-1/demystifying-rl-finetuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24888 2026-09-01 cs.AI 版本更新

SimGuide: Typed Multi-Context User Representations for Preference-Conditioned Agent Planning

SIMGUIDE:用于个性化智能体规划的过程式基础多上下文表示

Chirag Shah

机构 * University of Washington(华盛顿大学)

AI总结 本研究针对个性化AI智能体无法适配用户多场景优先级的问题,提出SIMGUIDE方法,构建SIMBENCH基准验证,发现过程式基础的Sims优于RAG,且表示格式是关键设计变量。

Comments Previous version had some results that were hard to verify or reproduce, so new experiments were done and many parts of the paper were changed to reflect that

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19197 2026-09-01 cs.CL cs.AI 版本更新

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: https://spade-rl.github.io ; Code: https://github.com/spade-rl/spade

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17027 2026-09-01 cs.RO 版本更新

FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences

FetchMan:基于模拟经验学习人形机器人视觉 locomotion-manipulation(移动操作)策略

Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

AI总结 该研究提出 FetchMan,通过端到端 sim-to-real 流水线训练人形机器人视觉移动操作策略,在 FetchMan-Bench 评估中,其单物体抓取策略在 Unitree G1 上零样本部署成功率达73.3%,并扩展至多物体训练。

Comments Project website: https://orayyan.com/fetchman

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10860 2026-09-01 cs.RO cs.CV 版本更新

Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility

Flex-$π$:具备计算灵活性的多流世界-动作模型

Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

AI总结 该研究提出Flex-$π$多流世界-动作模型,利用冻结的视频生成VAE实现多模态监督,通过混合专家Transformer与每流丢弃机制提升效率,在双臂操作任务上性能优于基线模型且运行更快。

Comments Project page: https://flex-pi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29689 2026-09-01 cs.CL 版本更新

Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理

Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UCSB(加州大学圣塔芭芭拉分校) University of Washington(华盛顿大学) UCLA(加州大学洛杉矶分校)

AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05371 2026-09-01 cs.LG cs.NA math.NA stat.ML 版本更新

Mamba-Assisted Non-Markovian Closure for Reduced-Order Modeling

Mamba辅助的非马尔可夫闭合用于降阶建模

Zhi-Feng Wei, Saad Qadeer, Panos Stinis

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) University of Washington(华盛顿大学) Brown University(布朗大学)

AI总结 针对高维动力系统降阶建模中的非马尔可夫闭合项问题,提出Mamba辅助闭合框架,利用Mamba序列模型从已解析轨迹预测闭合项,并通过数值积分器耦合降阶方程,在粘性Burgers方程和混沌双尺度Lorenz '96系统上优于马尔可夫模型、GRU序列模型和Wilks方法。

Comments Code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23927 2026-09-01 stat.ML cs.LG 版本更新

Soft Fitted Q-Iteration without Bellman Completeness: Occupancy Reweighting and Temperature Annealing

静态重加权实现软拟合Q迭代的局部收敛性

Lars van der Laan, Nathan Kallus

机构 * Department of Statistics, University of Washington(华盛顿大学统计学系)

AI总结 本文分析了在无Bellman完备性条件下软拟合Q迭代的稳定性机制,提出静态重加权软拟合Q迭代方法,证明其在近似可实现性和受控加权误差下具有有限样本局部线性收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23805 2026-09-01 stat.ML cs.LG 版本更新

Fitted Q-Evaluation without Bellman Completeness via Occupancy Weighting

无需贝尔曼完备性而通过稳态加权的拟Q评估

Lars van der Laan, Nathan Kallus

机构 * Department of Statistics, University of Washington(华盛顿大学统计学系)

AI总结 本文提出一种无需贝尔曼完备性的拟Q评估方法,通过稳态加权改进回归步骤,实现有限样本线性收敛,减少价值误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13551 2026-09-01 cs.CL 版本更新

Small Reward Models via Backward Inference

通过反向推理的小奖励模型

Yike Wang, Faeze Brahman, Shangbin Feng, Teng Xiao, Hannaneh Hajishirzi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

AI总结 FLIP通过反向推理实现无需参考和评分标准的奖励建模,在多个领域中显著提升性能并增强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏