arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

作者

Yejin Choi

Natural Language Processing

至 收录 365
2605.02937 2026-08-12 cs.LG cs.AI cs.CE 版本更新

Proteo-R1: Reasoning Foundation Models for De Novo Protein Design

Proteo-R1:用于从头蛋白质设计的推理基础模型

Fang Wu, Weihao Xuan, Heli Qi, Hanqun Cao, Heng-Jui Chang, Zeqi Zhou, Haokai Zhao, Ma Jian, Carl Ma, Yu-Chi Cheng, Kuan Pang, Xiangru Tang, Zehong Wang, Guanlue Li, Hanchen Wang, Kejun Ying, Pan Lu, Chiho Im, Seungju Han, Peng Xia, Tinson Xu, Yinxi Li, Deyao Zhu, Pheng-Ann Heng, Naoto Yokoya, Masashi Sugiyama, Li Erran Li, Jure Leskovec, Yejin Choi

AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。

Journal ref ICML 2026

URL PDF HTML 收藏
2509.23102 2026-08-12 cs.AI cs.CL 版本更新

Multiplayer Nash Preference Optimization

多玩家纳什偏好优化

Fang Wu, Xu Huang, Weihao Xuan, Zhiwei Zhang, Yijia Xiao, Guancheng Wan, Xiaomin Li, Bing Hu, Peng Xia, Jure Leskovec, Yejin Choi

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院) The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所智能系统研究中心) Pennsylvania State University(宾夕法尼亚州立大学) University of California, Los Angeles(加州大学洛杉矶分校) Harvard University(哈佛大学) UNC–Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出多玩家纳什偏好优化框架,扩展了传统的两玩家纳什对齐方法,通过引入多玩家博弈机制,提升对复杂非传递性人类偏好的对齐能力,并在多个基准测试中表现更优。

Journal ref ICLR 2026 Oral

URL PDF HTML 收藏
2605.15532 2026-08-11 cs.LG cs.AI cs.CL 版本更新

DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation

DeltaPrompts: 逃离多模态蒸馏中的零delta陷阱

Jaehun Jung, Hyunwoo Kim, Brandon Cui, Ximing Lu, David Acuna, Prithviraj Ammanabrolu, Yejin Choi

机构 * NVIDIA Research(NVIDIA研究院)

AI总结 本文提出DeltaPrompts,通过量化教师与学生之间的答案分歧(Δ)来生成高分歧的推理问题,从而解决传统蒸馏中因零delta提示导致的学习信号不足问题,实验表明DeltaPrompts在多个场景下显著提升了模型性能。

URL PDF HTML 收藏
2511.20639 2026-08-04 cs.CL cs.AI cs.LG 版本更新

Latent Collaboration in Multi-Agent Systems

多智能体系统中的潜在协作

Jiaru Zou, Ruizhong Qiu, Gaotang Li, Xiyuan Yang, Katherine Tieu, Pan Lu, Ke Shen, Hanghang Tong, Yejin Choi, Jingrui He, James Zou, Mengdi Wang, Ling Yang

机构 * University of Washington(华盛顿大学)

AI总结 提出LatentMAS框架,使LLM智能体在连续潜在空间直接协作,无需文本中介,实现更高精度、更低开销和更快推理。

Comments ICML2026 Spotlight, Project: https://github.com/Gen-Verse/LatentMAS

URL PDF HTML 收藏
2604.19341 2026-07-29 cs.LG cs.AI 版本更新

Structured Scaling of AI Discovery Across Diverse Scientific Domains

基于评估的科学发现扩展

Haotian Ye, Haowei Lin, Jingyi Tang, Yizhen Luo, Rahul Thapa, Caiyin Yang, Chang Su, Rui Yang, Ruihua Liu, Rundao Li, Zeyu Li, Pengwei Sun, Chong Gao, Dachao Ding, Guangrong He, Miaolei Zhang, Lina Sun, Wenyang Wang, Yuchen Zhong, Zhuohao Shen, Puheng Li, Pan Lu, Bianxiao Cui, Di He, Jianzhu Ma, Junfeng Li, Hexi Baoyin, Yejin Choi, Stefano Ermon, Xiaowen Chu, Tongyang Li, Yuzhi Xu, James Zou

机构 * Wizard Intelligence Learning Lab, Stanford University(智能巫师学习实验室,斯坦福大学) Peking University(北京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出SimpleTES框架,通过并行探索、反馈驱动精炼和局部选择,提升评估驱动的发现循环效率,解决科学发现扩展问题,展示在21个科学问题上超越基线模型的性能。

URL PDF HTML 收藏
2607.20062 2026-07-27 cs.CL 版本更新

Solar Open 2 Technical Report

太阳能开放2技术报告

Sungrae Park, Sanghoon Kim, Gyoungjin Gim, Jungho Cho, Hyunwoong Ko, Minbyul Jeong, Minjeong Kim, Keunwoo Choi, Chaehun Shin, Chanwoong Yoon, Dongjun Kim, Eunwon Kim, Gyungin Shin, Hyeonju Lee, Hyungkyu Kang, Inseo Song, Jisu Bae, Jiyoon Han, Jiyun Lee, Joonkee Kim, Junyeop Lee, Mikyoung Cha, Sangwon Yu, Sehwan Joo, Seokyoon Kang, Seonghoon Yang, Seung Shin, Seunghyun Lee, Seungseop Lim, Seungyoun Shin, Sukyung Lee, Taegyeong Eo, Taehwan Oh, Taewhoo Lee, Wonho Song, Wonjun Oh, Wonseok Hwang, Yunsu Kim, Yura Shim, Hwalsuk Lee, Sunghun Kim, Du-Seong Chang, Kyunghyun Cho, Seungju Han, Yejin Choi, Junsuk Choe, Hwaran Lee, Minjeong Ban, Yun Taewon, Hwanjun Song, Jae-Gil Lee, KyungTae Lim, Alice Oh

AI总结 本文介绍为长期代理任务构建的太阳能开放2语言模型。通过混合注意力堆栈等技术扩大规模,利用更强起点和高价值数据实现高效训练,经多教师策略蒸馏构建代理技能,在多项基准测试中表现出色,展示了其在语言模型领域的优势。

URL PDF HTML 收藏
2510.05592 2026-07-23 cs.AI cs.CL cs.LG cs.MA 版本更新

In-the-Flow Agentic System Optimization for Effective Planning and Tool Use

用于有效规划和工具使用的流内智能体系统优化

Zhuofeng Li, Haoxiang Zhang, Seungju Han, Sheng Liu, Jianwen Xie, Yu Zhang, Yejin Choi, James Zou, Pan Lu

机构 * Stanford University(斯坦福大学) Texas A&M University(德克萨斯农工大学) UC San Diego(圣地亚哥大学) Lambda Website(Lambda网站)

AI总结 研究针对大语言模型中工具增强方法的不足,提出可训练的流内智能体框架AgentFlow及Flow-GRPO训练方法,通过协调模块优化规划器,在多基准测试中表现优异,展现流内优化优势。

Comments 47 pages, 12 figures. ICLR 2026 Oral. Project website: https://agentflow.stanford.edu/

URL PDF HTML 收藏
2505.20161 2026-07-21 cs.LG cs.AI cs.CL 版本更新

Prismatic Synthesis: Gradient-based Data Diversification Boosts Generalization in LLM Reasoning

棱柱形合成:基于梯度的数据多样化提升语言模型推理中的泛化能力

Jaehun Jung, Seungju Han, Ximing Lu, Skyler Hallinan, David Acuna, Shrimai Prabhumoye, Mostafa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Yejin Choi

机构 * NVIDIA Research(NVIDIA研究部) University of Washington(华盛顿大学) University of Southern California(南加州大学)

AI总结 研究语言模型训练数据多样性对泛化的作用,提出基于梯度熵的G - Vendi指标,进而构建棱柱形合成框架生成多样合成数据,有效提升模型性能,在多个基准测试中表现优于依赖更大数据生成器的模型。

URL PDF HTML 收藏
2506.07468 2026-07-07 cs.LG cs.CL cs.MA 版本更新

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

通过在线自我博弈强化学习追踪移动目标以实现更安全的语言模型

Mickel Liu, Liwei Jiang, Yancheng Liang, Simon Shaolei Du, Yejin Choi, Tim Althoff, Natasha Jaques

AI总结 研究传统大语言模型安全对齐问题,引入Self-RedTeam算法,通过在线自我博弈多智能体强化学习持续共同进化攻防策略,有理论安全保障,实证效果好,推动从被动修补到主动协同进化转变。

Comments ICML 2026 Poster

URL PDF HTML 收藏
2606.23830 2026-06-24 cs.LG cs.AI 新提交

Deciphering Fingerprints of 3D Molecular Surfaces for Accurate Epitope Prediction

解读3D分子表面指纹以实现准确的表位预测

Fang Wu, Weihao Xuan, Jure Leskovec, Yejin Choi, Li Erran Li

机构 * Stanford University(斯坦福大学) The University of Tokyo(东京大学) Amazon AWS(亚马逊AWS)

AI总结 提出SurfBind框架,直接基于分子表面表示,通过Transformer架构、补丁级表面建模、结合物感知交叉注意力和分层粗到细预测范式,实现表位预测,在SAbDab和DB5.5基准上达到最先进性能。

Journal ref KDD 2026 AI4Science

URL PDF HTML 收藏
2606.18216 2026-06-17 cs.CL 新提交

Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients

近端策略优化区域:教师存在于提示中,而非梯度中

Byung-Kwan Lee, Ximing Lu, Shizhe Diao, Minki Kang, Saurav Muralidharan, Karan Sapra, Andrew Tao, Pavlo Molchanov, Yejin Choi, Yu-Chiang Frank Wang, Ryo Hachiuma

机构 * NVIDIA(英伟达)

AI总结 提出ZPPO方法,通过将教师知识注入提示而非策略梯度,解决小模型知识蒸馏中教师梯度主导和强化学习策略漂移问题,在多种规模模型上超越现有方法。

Comments Project page: https://byungkwanlee.github.io/ZPPO-page/

URL PDF HTML 收藏
2606.17321 2026-06-17 cs.LG cs.CV 新提交

ProCUA-SFT Technical Report

ProCUA-SFT 技术报告

Jaehun Jung, Ximing Lu, Brandon Cui, Muhammad Khalifa, Shaokun Zhang, Hao Zhang, Jin Xu, Amala Sanjay Deshmukh, Karan Sapra, Andrew Tao, Yejin Choi, Jan Kautz, Mingjie Liu, Yi Dong

机构 * NVIDIA(英伟达) University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

AI总结 提出 ProCUA-SFT 数据集,通过自动化管道从 2484 个应用组合的合成轨迹中蒸馏出 310 万步级 SFT 样本,微调 UI-TARS 7B 在 OSWorld 上达到 45.0% 的成功率,比基线提升 18.7 个百分点。

Comments 15 pages, 5 figures

URL PDF HTML 收藏
2606.15216 2026-06-16 cs.CL cs.AI 新提交

Spokes: Optimizing for Diverse Pretraining Data Selection

Spokes: 优化多样化预训练数据选择

Clarence Lee, Yejin Choi, Luke Zettlemoyer, Pang Wei Koh, Hai Leong Chieu

机构 * DSO National Laboratories(DSO国家实验室) Stanford University(斯坦福大学) University of Washington(华盛顿大学)

AI总结 提出基于G-Vendi分数的概率多样化框架,通过指数梯度下降直接优化数据多样性,在FineWeb和DCLM上提升下游性能1.5和1.4个点。

Comments 9 pages, 4 figures

URL PDF HTML 收藏
2606.15007 2026-06-16 cs.CL cs.AI cs.LG 新提交

Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

Nemotron 3 Ultra: 开放、高效的混合专家Mamba-Transformer模型用于智能体推理

NVIDIA, :, Aaron Blakeman, Aaron Thomas, Aastha Jhunjhunwala, Abhibha Gupta, Abhinav Khattar, Adam Rajfer, Adi Renduchintala, Adil Asif, Aditya Vavre, Adriana Flores Miranda, Ahmad Bilal, Aileen Zaman, Ajay Hotchandani, Akanksha Shukla, Akhiad Bercovich, Aleksander Ficek, Alex Gronskiy, Alex Kondratenko, Alex Steiner, Alex Ye, Alexander Bukharin, Alexandre Milesi, Ali Taghibakhshi, Alice Gatti, Alisa Liu, Alok Kumar, Amar Phanishayee, Ameya Sunil Mahabaleshwarkar, Amir Klein, Amit Zuker, Amnon Geifman, Anahita Bhiwandiwalla, Ananth Subramaniam, Andrea Santilli, Andrew Fulks, Andrew McHarg, Andrew Tao, Andrii Skliar, Anjulie Agrusa, Ankur Srivastava, Ankur Verma, Anna Shors, Anna Warno, Antoni-Joan Solergibert I Llaquet, Arham Mehta, Arkadiusz Nowaczynski, Arti Jain, Ashwath Aithal, Ashwin Poojary, Asif Ahamed, Asit Mishra, Asma Kuriparambil Thekkumpate, Atefeh Sohrabizadeh, Avinash Kaur, Avinash Vem, Ayush Dattagupta, Barath Subramaniam Anandan, Bardiya Sadeghi, Ben Lanir, Benedikt Schifferer, Besmira Nushi, Bilal Kartal, Bill Thiede, Bita Darvish Rouhani, Bo Deng, Bob Schatz, Boris Ginsburg, Boxin Wang, Brad Nemire, Brandon Norick, Brian Dang, Brian Westphal, Brian Yu, Brucek Khailany, Bryan Catanzaro, Carlo del Mundo, Caryln Aarish, Chankyu Lee, Chantal Hwang, Charbel Sakr, Charles Wang, Charlie Truong, Chen Cui, Cheng Cheng, Cheng-Ping Hsieh, Chenghao Zhang, Chenhui Deng, Chintan Patel, Chris Alexiuk, Christian Cosgrove, Christian Munley, Christine Harvey, Christopher Parisien, Chunyang Shen, Coco Li, Collin Neale, Cynthia Gao, Cyril Meurillon, Dan Gil, Dan Su, Dan Zhao, Dane Corneil, Daniel Afrimi, Daniel Egert, Daniel Korzekwa, Daniel Lo, Daniel Machlab, Daniel Serebrenik, Daniil Sorokin, Daria Gitman, Daria Levy, Darko Stosic, David Mosallanezhad, David Yu, Davit Karamyan, Deena Donia, Deep Debroy, Deepak Narayanan, Devin O'Kelly, Dheeraj Peri, Dhruv Nathawani, Di, Wu, Dima Rekesh, Divyanshu Kakwani, Donald Plummer, Dong Anh, Dongfeng Yu, Dongfu Jiang, Donnie Kim, Dorrin Poorkay, Duncan Riach, Dusan Stosic, Dustin VanStee, Eavan Meng, Edgar Minasyan, Edward Lin, Eileen Margaret Peters Long, Elad Sarafin, Elad Segal, Elena Lantz, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Pham-Hung, Eric Tramel, Eric Yang, Erick Galinkin, Erik Pounds, Erika Goncalves Goncalves, Evan Briones, Evan Wu, Evelina Bakhturina, Evgeny Tsykunov, Ewa Dobrowolska, Faisal Ladhak, Farzan Memarian, Fay Wang, Fei Jia, Felipe Soares, Felipe Vieira Frujeri, Feng Chen, Fengguang Lin, Ferenc Galko, Frank Sun, Frankie Siino, Frida Hou, Gal Hubara Agam, Gal Kaplun, Gantavya Bhatt, Gargi Prasad, Garvit Kulshreshtha, George Armstrong, Gerald Shen, Giulio Borghesi, Gordana Neskovic, Gorkem Batmaz, Grace Lam, Greg Mason, Greg Pauloski, Grigor Nalbandyan, Grzegorz Chlebus, Grzegorz Karch, Guan-Ting Liu, Guoming Zhang, Guyue Huang, Haggai Maron, Haifeng Qian, Haim Elisha, Haoxing Ren, Haran Kumar Shiv Kumar, Haribhau Hud, Harris Nover, Harrison Saturley Hall, Hayate Iso, Helen Ngo, Herbert Hum, Herman Sahota, Hexin Wang, Himanshu Soni, Hovhannes Tamoyan, Hua Li, Huanhuan Chen, Hui Li, Hui Wang, Huy Nguyen, Ian Chiles, Ido Galil, Ido Shahaf, Igor Gitman, Igor Shovkun, Ilya Loshchilov, Ingo Guehring, Itamar Schen, Itay Levy, Itay Neeman, Ivan Moshkov, Izik Golan, Izzy Putterman, Jaemin Choi, Jakub Slowikowski, Jan Kautz, Jane Polak Scowcroft, Jared Casper, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jiacheng Xu, Jiafan Zhu, Jialin Song, Jian Zhang, Jiantao Jiao, Jiaqi Zeng, Jie Lou, Jim King, Jimmy Zhang, Jingquan Wang, Jinhang Choi, Jinju Chu, Joey Conway, Joey Guman, Johan Jatko, Johannes Rausch, John Kamalu, John Roberts, Johnny Greco, Johnny Mensel, Jonah Alben, Jonas Yang, Jonathan Cohen, Jonathan Raiman, Joseph Jennings, Joshua Mabry, Joshua Pierce, Joyjit Daw, Julien Veron Vialard, Junkeun Yi, Jupinder Parmar, Kajal Jain, Kan Zhu, Kari Briski, Katherine Cheung, Katherine Luna, Keith Willowhawk, Keith Wyss, Keshav Santhanam, Kevin Shih, Kezhi Kong, Khanh Nguyen, Khushi Bhardwaj, Kirthi Shankar Sivamani, Konstantinos Krommydas, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Kyle Keprios, Kylie Day, Lawrence McAfee, Leo Du, Leon Derczynski, Li Ding, Linda Liu, Lingjie Wu, Lior Kadoch, Lizzie Wei, Luis Vega, Luke Robison, Lun Su, Maarten Van Segbroeck, Maciej Jakub Mikulski, Maer Rodrigues de Melo, Magda Sypula, Mahan Fathi, Makesh Narsimhan Sreedhar, Makesh Tarun Chandran, Manoj Kilaru, Maor Ashkenazi, Marc Cuevas, Marc Romeijn, Marcin Chochowski, Mark Cai, Mark Mozolewski, Markus Kliegl, Marta Stepniewska-Dziubinska, Martyna Patelka, Mattei Machczynski, Matvei Novikov, Mauricio Ferrato, Maximilian Golub, Mehrzad Samadi, Melissa Corpuz, Mengru Wang, Mengxi Wu, Meredith Price, Meriem Boubdir, Micah Schaffer, Michael Andersch, Michael Boone, Michael Gschwind, Michael Lightstone, Michael Loh, Michal Bien, Michal Zawalski, Michelle Gill, Miguel Martinez, Mikail Khona, Mike Chrzanowski, Mike Houston, Mingyuan Ma, Minseok Lee, Mohamed Fawzy, Mohammad Dabbah, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Najeeb Nabwani, Namit Dhameja, Narimane Hennouni, Natalie Hereth, Nathaniel Pinckney, Nave Algarici, Nave Assaf, Netanel Haber, Nicholas Knight, Nick Reamaroon, Nickson Quak, Nidhi Bhatia, Nikhil Desai, Nikolai Ludwig, Nima Tajbakhsh, Ning Xu, Nir Ailon, Nirmal Juluru, Nitin Nitin, Ofri Masad, Oleg Rybakov, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivia Viessmann, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Omri Puny, Oren Tropp, Pablo Ribalta, Pallab Bhattacharya, Panos Lampropoulos, Parth Mannan, Pasha Shamis, Patrick Legresley, Paul Gibbons, Pavlo Molchanov, Pawel Morkisz, Peter Dykas, Peter Jin, Pierre-Yves Aquilanti, Pinky Xu, Piotr Januszewski, Piotr Laskiewicz, Pooya Jannaty, Prakash Gurumurthy, Pranav Prashant Thombre, Prasoon Varshney, Pritam Gundecha, Przemek Tredak, Puhui Meng, Qiyu Wan, Rabeeh Karimi Mahabadi, Rachel Oberman, Rachit Garg, Radha Sri-Tharan, Rahul Kandu, Rakshit Sanadhya, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Ray Macalisang, Rayen Tian, Reka Kovacs, Renjie Pi, Rick Izzo, Rima Shahbazyan, Rishabh Garg, Rishi Puri, Rita Fernandes Neves, Ritchie Zhao, Ritika Borkar, Ritu Gala, Riyad Islam, Robert Clark, Robert Hesse, Robert Kirby, Roger Waleffe, Rohit Watve, Roi Koren, Ron Banner, Ruoxi Zhang, Russell J. Hewett, Ryan Prenger, Ryan Stewart, Ryota Egashira, Sadegh Mahdavi, Saee Paliwal, Sagar Singh, Sahil Modi, Salika Dave, Samantha Shinagawa, Samuel Kriman, Sandip Bhaskar, Sangkug Lym, Sanjay Kariyappa, Sanjeev Satheesh, Saran Vikas Murari, Satish Pasumarthi, Saurabh Mishra, Saurav Muralidharan, Scott Hara, Sean Narentharen, Selvaraj Anandaraj, Seonjin Na, Seonmeyong Bak, Seonmyeong Bak, Sepehr Sameni, Seph Mard, Serge Panev, Seth Henneman, Seth Poulos, Shahar Mor, Shantanu Acharya, Shaona Ghosh, Sharath Turuvekere Sreenivas, Sharon Mendelson, Shaun Kotek, Shawn Wang, Shay Aharon, Shaya Gharghabi, Sheng-Chieh Lin, Shi Chen, Shiqing Fan, Shirish Baskaran, Shreya Gopa, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuoyang Ding, Shwetha Krishnamurthy, Siddharth Singh, Simeng Sun, Sirshak Das, Sivakumar Arayandi Thottakara, Smita Ithape, Somshubra Majumdar, Soumye Singhal, Sri Harsha Singudasu, Sridhar Bhuvanapalli, Srimukh Veccham, Stas Sergienko, Stefania Alborghetti, Stephen Ge, Su Rong, Sugam Dipak Devare, Sukrit Rao, Sumeet Kumar Barua, Sungsoo Ha, Sunny Gai, Suriya Gunasekar, Suseella Panguluri, Suyog Gupta, Sviataslau Hinzburh, Sweta Priyadarshi, Syeda Nahida Akter, Talor Abramovich, Tan Bui, Tanay Varshney, Tatevik Ter-Hovhannisyan, Teodor-Dumitru Ene, Terry Kong, Thanh Do, Tianhe Zhang, Tiffany Moore, Tijmen Blankevoort, Tim Moon, Tiyasa Mitra, Tom Balough, Tomasz Grzegorzek, Tomasz Hliwiak, Tomer Asida, Tomer Bar Natan, Tomer Keren, Tomer Ronen, Tony Salim, Tony Wang, Traian Rebedea, Tugrul Konuk, Twinkle Vashishth, Udi Karpas, Ushnish De, Vahid Noorozi, Venkat Srinivasan, Venmugil Elango, Vibhor Agrawal, Victor Cui, Vijay Korthikanti, Vikas Mehta, Vinay Rao, Virginia Wu, Vitaly Kurin, Vitaly Lavrukhin, Vladimir Anisimov, Vu Pham, Wanli Jiang, Wasi Uddin Ahmad, Wataru Ishihara, Wei Du, Wei Ping, Weiheng Chai, Wenliang Dai, Wesley Helmholz, Will Jennings, Will Zhu, Wojciech Prazuch, Xiaowei Ren, Xiwen Yu, Yan Breek, Yang Chen, Yang Yu, Yangyi Chen, Yaniv Galron, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Ying Lin, Yonatan Geifman, Yonggan Fu, Youngeun Kwon, Yu Yao, Yugi Guvvla, Yuki Huang, Yunsheng Liu, Zach Moshe, Zachary Newell, Zhilin Wang, Zhiyu Li, Zhongbo Zhu, Zhuolin Yang, Zihan Liu, Zijie Yan, Zsolt-Alon Wertheimer

机构 * NVIDIA(英伟达)

AI总结 提出550B总参数量、55B激活参数的混合专家Mamba-Attention语言模型Nemotron 3 Ultra,通过20T tokens预训练、1M上下文扩展及后训练,在推理吞吐量提升约6倍的同时保持与顶尖模型相当的精度。

URL PDF HTML 收藏
2510.16380 2026-06-12 cs.CL cs.AI cs.CY cs.HC cs.LG 版本更新

MoReBench: Evaluating Procedural and Pluralistic Moral Reasoning in Language Models, More than Outcomes

MoReBench:评估语言模型中的程序性和多元道德推理,超越结果

Yu Ying Chiu, Michael S. Lee, Rachel Calcott, Brandon Handoko, Paul de Font-Reaulx, Raphaël Millière, Paula Rodriguez, Chen Bo Calvin Zhang, Ziwen Han, Udari Madhushani Sehwag, Yash Maurya, Christina Q Knight, Harry R. Lloyd, Florence Bacus, Conor Downey, Mantas Mazeika, Bing Liu, Yejin Choi, Mitchell L Gordon, Sydney Levine

机构 * University of Washington(华盛顿大学) New York University(纽约大学) Scale AI Harvard University(哈佛大学) University of Michigan(密歇根大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Center for AI Safety(人工智能安全中心) Stanford University(斯坦福大学) MIT(麻省理工学院) University of Oxford(牛津大学)

AI总结 提出MoReBench基准,包含1000个道德场景和超过2.3万条标准,用于评估语言模型在道德推理中的程序性推理能力,发现现有基准无法预测模型表现,且模型对特定道德框架存在偏好。

Comments 46 pages, 8 figures, 10 tables. Published in ICLR 2026. Accepted at CHAI workshop and SPP 2026 (non-archival)

URL PDF HTML 收藏
2606.07812 2026-06-09 cs.AI cs.CL 新提交

Scaling Participation in Modular AI Systems

模块化AI系统中的参与扩展

Shangbin Feng, Yike Wang, Weijia Shi, Luke Zettlemoyer, Yejin Choi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 提出参与扩展范式,通过多方贡献小模型构建模块化AI系统,在15项任务上比单体大语言模型提升高达15.4%,并展现涌现能力。

URL PDF HTML 收藏
2606.07567 2026-06-09 q-bio.BM cs.AI cs.CE 新提交

SurfDesign: Effective Protein Design on Molecular Surfaces

SurfDesign:基于分子表面的高效蛋白质设计

Fang Wu, Shuting Jin, Xiangru Tang, Mark Gerstein, Xiangxiang Zeng, Yejin Choi, Jure Leskovec, Jinbo Xu

机构 * Stanford University(斯坦福大学) Wuhan University of Science and Technology(武汉科技大学) Yale University(耶鲁大学) School of Medicine, Yale University(耶鲁大学医学院) Hunan University(湖南大学) Yuelushan Laboratory(岳麓实验室) Kumo.AI Toyota Technological Institute at Chicago(芝加哥技术研究所)

AI总结 提出SurfDesign框架,将分子表面建模为连续几何流形并整合预训练蛋白质语言模型,通过表面等变消息传递捕捉几何特征,在从头设计结合子和酶设计基准上优于现有方法。

Journal ref KDD 2026 AI4Science

URL PDF HTML 收藏
2505.05026 2026-06-05 cs.CL cs.LG

Do MLLMs Capture How Interfaces Guide User Behavior? A Benchmark for Multimodal UI/UX Design Understanding

多模态用户界面/用户体验设计理解的基准测试:MLLMs能否捕捉界面如何引导用户行为?

Jaehyun Jeon, Min Soo Kim, Jang Han Yoon, Sumin Shim, Yejin Choi, Hanbin Kim, Dae Hyun Kim, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学) NC AI

AI总结 本文提出WiserUI-Bench基准测试,用于评估多模态UI/UX设计对用户行为的影响,通过300对真实世界UI图像对和专家解读,发现MLLMs在理解UI/UX设计行为影响方面存在局限。

Comments ACL 2026 Main. Our code and dataset: https://github.com/jeochris/wiserui-bench

URL PDF HTML 收藏
2605.30326 2026-05-29 cs.RO cs.AI

RoboWits: Unexpected Challenges for Robotic Creative Problem Solving

RoboWits:机器人创造性问题解决中的意外挑战

Chunru Lin, Hongxin Zhang, Fenghao Yu, Zhehuan Chen, Thomas L. Griffiths, Yejin Choi, David Held, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Princeton University(普林斯顿大学) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出RoboWits双臂机器人基准,通过多智能体协作的自动化任务生成流水线评估机器人在几何、材料和装配推理中的认知推理、创造性工具使用及鲁棒性,发现预训练VLA在突变任务中表现脆弱。

Comments The first two authors contributed equally

URL PDF HTML 收藏
2509.21882 2026-05-27 cs.LG cs.AI

Position: The Hidden Costs and Measurement Gaps of Reinforcement Learning with Verifiable Rewards

立场:具有可验证奖励的强化学习的隐藏成本与测量缺口

Fang Wu, Aaron Tu, Weihao Xuan, Heli Qi, Xu Huang, Qingcheng Zeng, Shayan Talaei, Yijia Xiao, Peng Xia, Xiangru Tang, Yuchen Zhuang, Yinxi Li, Bing Hu, Hanqun Cao, Wenqi Shi, Rui Yang, Nan Liu, Huaxiu Yao, Ge Liu, Li Erran Li, Amin Saberi, Naoto Yokoya, Jure Leskovec, Yejin Choi

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Waseda University(早稻田大学) Georgia Tech(佐治亚理工学院) Northwestern University(西北大学) UCLA(加州大学洛杉矶分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Yale University(耶鲁大学) University of Waterloo(滑铁卢大学) Independent Researcher(独立研究者) CUHK(香港中文大学) UT Southwestern Medical Center(西南医学中心) National University of Singapore(新加坡国立大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Amazon AWS AI(亚马逊AWS人工智能)

AI总结 本文指出,具有可验证奖励的强化学习(RLVR)在提升大语言模型性能时,常因预算不匹配、尝试膨胀和基准数据污染等混淆因素导致收益被高估,并提出了预算匹配饱和曲线、校准跟踪、法官鲁棒性测试和污染筛查等最低标准。

URL PDF HTML 收藏
2605.18746 2026-05-26 cs.CV cs.AI cs.CL cs.LG cs.RO

ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop

ESI-Bench: 迈向闭环感知-动作的具身空间智能

Yining Hong, Jiageng Liu, Han Yin, Manling Li, Leonidas Guibas, Li Fei-Fei, Jiajun Wu, Yejin Choi

机构 * Stanford University(斯坦福大学) UCLA(加州大学洛杉矶分校) Northwestern University(西北大学)

AI总结 提出ESI-BENCH基准,通过主动探索(感知、移动、操作)在OmniGibson环境中评估具身空间智能,发现主动探索显著优于被动方法,失败主因是动作盲视而非感知弱,且模型存在元认知差距。

Comments https://esi-bench.github.io/

URL PDF HTML 收藏
2602.21198 2026-05-26 cs.LG cs.AI cs.CL cs.CV cs.RO

Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs

从试错中学习:具身大语言模型的反思式测试时规划

Yining Hong, Huang Huang, Manling Li, Li Fei-Fei, Leonidas Guibas, Jiajun Wu, Yejin Choi

机构 * Stanford University(斯坦福大学) Northwestern University(西北大学)

AI总结 提出反思式测试时规划方法,通过行动中反思和行动后反思两种模式,结合回溯性反思,使具身智能体在测试时进行自我纠正和经验积累,显著提升长程任务性能。

URL PDF HTML 收藏
2605.22791 2026-05-22 cs.AI

Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention

Gated DeltaNet-2:解耦擦除与写入的线性注意力

Ali Hatamizadeh, Yejin Choi, Jan Kautz

机构 * NVIDIA

AI总结 本文提出Gated DeltaNet-2,通过引入通道级擦除门和写入门,解耦了线性注意力中擦除与写入的控制,从而在语言模型、常识推理和检索任务中取得了最佳性能,特别是在长上下文检索任务中表现突出。

Comments Gated DeltaNet-2 technical report; code at https://github.com/NVlabs/GatedDeltaNet-2

URL PDF HTML 收藏
2605.20285 2026-05-21 cs.LG cs.AI

Introspective X Training: Feedback Conditioning Improves Scaling Across all LLM Training Stages

反思式X训练:反馈条件化提升跨所有LLM训练阶段的扩展性

Brandon Cui, Ximing Lu, Jaehun Jung, Syeda Nahida Akter, Hyunwoo Kim, Yuxiao Qu, David Acuna, Shrimai Prabhumoye, Yejin Choi, Prithviraj Ammanabrolu

机构 * NVIDIA University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) UC San Diego(南加州大学)

AI总结 本文提出反思式训练(IXT),通过利用后续阶段的动态来改进早期阶段,从而提高LLM训练的扩展效率,实验表明该方法在计算效率和性能上均有显著提升。

URL PDF HTML 收藏
2605.17077 2026-05-19 cs.RO cs.AI

How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning

如何指导你的机器人:密集语言标注助力机器人策略学习

Bosung Kim, Ruiyi Wang, David Acuna, Jaehun Jung, Alexander Trevithick, Brandon Cui, Yejin Choi, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校) NVIDIA

AI总结 本研究通过密集语言标注提升机器人策略学习效率,提出DeMiAn方法,利用视觉语言模型生成多方面标注,提升策略和世界模型性能,无需新增演示数据。

URL PDF HTML 收藏
2510.18941 2026-05-19 cs.CL cs.AI cs.LG

ProfBench: Multi-Domain Rubrics requiring Professional Knowledge to Answer and Judge

ProfBench:需要专业知识回答和评判的多领域评分标准

Zhilin Wang, Jaehun Jung, Ximing Lu, Shizhe Diao, Ellie Evans, Jiaqi Zeng, Pavlo Molchanov, Yejin Choi, Jan Kautz, Yi Dong

机构 * NVIDIA

AI总结 ProfBench通过7000多个由专业领域专家评估的响应-评分对,评估大语言模型在处理专业文档、信息整合和生成综合报告方面的能力,揭示了即使顶级模型在专业任务上也面临挑战。

Comments Published at ICLR 2026, 30 pages

URL PDF HTML 收藏
2605.08144 2026-05-12 cs.LG cs.AI cs.CV

NoiseRater: Meta-Learned Noise Valuation for Diffusion Model Training

NoiseRater: 用于扩散模型训练的元学习噪声估值

Fang Wu, Haokai Zhao, Da Xing, Hanqun Cao, Tinson Xu, Yanchao Li, Xiangru Tang, Zehong Wang, Aaron Tu, Kuan Pang, Hanchen Wang, Hongbin Lin, Zeqi Zhou, Yinxi Li, Peng Xia, Li Erran Li, Molei Tao, Jure Leskovec, Aditya Joshi, Yejin Choi

机构 * Stanford University(斯坦福大学) UNSW(新南威尔士大学) UCL(伦敦大学学院) The University of Chicago(芝加哥大学) CUHK(香港中文大学) Nanjing University(南京大学) Brown University(布朗大学) Yale University(耶鲁大学) University of Notre Dame(Notre Dame 大学) University of Waterloo(滑铁卢大学) UCB(加州大学伯克利分校) Georgia Technology(佐治亚理工学院) Amazon(亚马逊)

AI总结 本文提出NoiseRater,通过元学习实现实例级噪声估值,提升扩散模型训练效率和生成质量。

URL PDF HTML 收藏
2605.05242 2026-05-08 cs.IR cs.AI

Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction

超越语义相似性:通过直接语料交互重新思考代理搜索的检索

Zhuofeng Li, Haoxiang Zhang, Cong Wei, Pan Lu, Ping Nie, Yi Lu, Yuyang Bai, Shangbin Feng, Hangxiao Zhu, Ming Zhong, Yuyu Zhang, Jianwen Xie, Yejin Choi, James Zou, Jiawei Han, Wenhu Chen, Jimmy Lin, Dongfu Jiang, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(圣地亚哥大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Verdent AI Lambda

AI总结 本文提出直接语料交互(DCI)方法,通过通用终端工具直接搜索原始语料,无需嵌入模型或检索接口,有效提升代理搜索性能。

URL PDF HTML 收藏
2508.09603 2026-04-28 cs.CL

The Surprising Effectiveness of Membership Inference with Simple N-Gram Coverage

基于简单n-gram覆盖的成员推断的惊人效果

Skyler Hallinan, Jaehun Jung, Melanie Sclar, Ximing Lu, Abhilasha Ravichander, Sahana Ramnath, Yejin Choi, Sai Praneeth Karimireddy, Niloofar Mireshghallah, Xiang Ren

机构 * University of Southern California(南加州大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 本文提出基于文本输出的成员推断攻击,通过n-gram重叠度评估模型生成文本与真实后缀的相似性,验证了其在黑盒模型上的有效性,并发现攻击成功率随计算预算增加而提升。

Comments CoLM 2025. v2: update citation

URL PDF HTML 收藏
2505.01700 2026-04-28 cs.LG q-bio.QM

PoseX: AI Defeats Physics Approaches on Protein-Ligand Cross Docking

PoseX:人工智能击败物理方法在蛋白质-配体交叉对接

Yize Jiang, Xinze Li, Yuanyuan Zhang, Jin Han, Youjun Xu, Ayush Pandit, Zaixi Zhang, Mengdi Wang, Mengyang Wang, Minjie Shen, Guang Yang, Yejin Choi, Wu-Jun Li, Tianfan Fu, Fang Wu, Junhong Liu

机构 * Microcyto Purdue University(普渡大学) State Key Laboratory for Novel Software Technology at Nanjing University(南京大学新型软件技术国家重点实验室) Anew Therapeutics Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Peking University(北京大学) Virginia Tech(弗吉尼亚理工大学) Imperial College London(伦敦帝国理工学院)

AI总结 PoseX设计了一个开放源代码的基准测试,评估自我对接和交叉对接,通过23种方法和718/1312个数据集,发现AI方法在对接成功率上优于物理方法,并通过放松方法和结合口袋信息提升性能。

URL PDF HTML 收藏