arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5001 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5001 篇

2604.00687 2026-04-02 cs.SE 67%

SCPatcher: Automated Smart Contract Code Repair via Retrieval-Augmented Generation and Knowledge Graph

SCPatcher:通过检索增强生成与知识图谱实现智能合约代码自动修复

Xiaoqi Li, Shipeng Ye, Wenkai Li, Zongwei Li

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出SCPatcher框架,结合检索增强生成与知识图谱实现智能合约漏洞自动修复,通过构建5000个验证过的以太坊合约知识图谱,提升大语言模型推理能力,实现高修复率和编译通过率。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00657 2026-04-02 cs.SE cs.CR 67%

LibScan: Smart Contract Library Misuse Detection with Iterative Feedback and Static Verification

LibScan: 利用迭代反馈和静态验证的智能合约库误用检测

Yishun Wang, Wenkai Li, Xiaoqi Li, Zongwei Li, Lei Xie, Yuqing Zhang

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract)

AI总结 本文提出LibScan框架,结合大语言模型和规则分析,识别智能合约中八类库误用,通过迭代修正和知识库提升检测准确率至85.15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28106 2026-03-31 cs.HC 67%

InconLens: Interactive Visual Diagnosis of Behavioral Inconsistencies in LLM-based Agentic Systems

InconLens:交互式可视化诊断LLM基于代理系统的行为主观不一致性

Shuo Yan, Xiaolin Wen, Shaolun Ruan, Yanjie Zhang, Jiaming Mi, Yushi Sun, Huamin Qu, Rui Sheng

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract)

AI总结 本文提出InconLens系统,通过信息节点抽象实现跨运行行为分析,帮助开发者更高效识别分歧点并提升代理系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04618 2026-03-31 cs.LG cs.AI cs.CL 67%

Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models

代理情境工程:为自我改进语言模型演化情境

Qizheng Zhang, Changran Hu, Shubhangi Upasani, Boyuan Ma, Fenglu Hong, Vamsidhar Kamanuru, Jay Rainton, Chen Wu, Mengmeng Ji, Hanchen Li, Urmish Thakker, James Zou, Kunle Olukotun

机构 * Stanford University(斯坦福大学) SambaNova Systems, Inc.(SambaNova Systems公司) UC Berkeley(加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ACE框架,通过生成、反思和整理的模块化过程,使情境持续进化,提升语言模型在代理和领域推理中的性能,减少适应延迟和成本。

Comments ICLR 2026; 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13303 2026-03-27 cs.CV 67%

ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement

ShowTable:通过协作反思与精炼解锁创意表格可视化

Zhihang Liu, Xiaoyi Bao, Pandeng Li, Junjie Zhou, Zhaohe Liao, Yefei He, Kaixun Jiang, Chen-Wei Xie, Yun Zheng, Hongtao Xie

机构 * USTC(中国科学技术大学) CASIA(中国科学院自动化研究所) NJU(南京大学) SJTU(上海交通大学) ZJU(浙江大学) FDU(福建师范大学) Tongyi Lab(通义实验室)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract)

AI总结 本文提出ShowTable框架,结合大语言模型与扩散模型,通过逐步自我纠正过程实现创意表格可视化,引入TableVisBench基准测试,展示其在多模态推理、生成和纠错方面的优势。

Comments Accepted to CVPR 2026, project page: https://lntzm.github.io/showtable-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10862 2026-03-16 cs.CL cs.AI cs.CR cs.CY cs.LG 67%

Superficial Safety Alignment Hypothesis

表面安全对齐假说

Jianwei Li, Jung-Eun Kim

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出表面安全对齐假说,认为安全对齐通过让模型选择正确推理方向来实现,识别出四种关键组件以建立安全防护。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08706 2026-03-10 cs.AI cs.CL cs.LG 67%

Agentic Critical Training

代理批判训练

Weize Liu, Minghui Liu, Sy-Tuyen Ho, Souradip Chakraborty, Xiyao Wang, Furong Huang

机构 * University of Maryland College Park(马里兰大学学院公园分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 代理批判训练(ACT)是一种强化学习方法,通过奖励模型判断替代行为的正确性,使模型自主发展对行为质量的推理,从而提升代理性能和泛化能力。

Comments Project page: https://attention-is-all-i-need.github.io/ACT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14996 2026-03-10 cs.CL cs.AI cs.LG 67%

MAS-ZERO: Designing Multi-Agent Systems with Zero Supervision

MAS-ZERO:无需监督设计多智能体系统

Zixuan Ke, Austin Xu, Yifei Ming, Xuan-Phi Nguyen, Ryan Chin, Caiming Xiong, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MAS-ZERO通过元层面设计实现无需监督的多智能体系统自动设计,提升推理、编程和代理任务的性能。

Comments SEA@NeurIPS (Oral) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04364 2026-03-05 cs.LG cs.AI cs.CL 67%

Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks

双模多阶段对抗安全训练:增强多模态网络代理对跨模态攻击的鲁棒性

Haoyu Liu, Dingcheng Li, Lukas Rutishauser, Zeyu Zheng

机构 * UC Berkeley, IEOR & BAIR(伯克利大学) Google(谷歌) Google Deepmind(谷歌DeepMind)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DMAST通过三阶段对抗训练提升多模态网络代理对跨模态攻击的鲁棒性,显著提高任务完成效率并优于现有防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20278 2026-03-03 cs.LG cs.AI cs.CL 67%

Characterizing Pattern Matching and Its Limits on Compositional Task Structures

刻画模式匹配及其在组合任务结构中的限制

Hoyeon Chang, Jinho Park, Hanseul Cho, Sohee Yang, Miyoung Ko, Hyeonbin Hwang, Seungpil Won, Dohaeng Lee, Youbin Ahn, Minjoon Seo

机构 * KAIST AI(韩国科学技术院人工智能研究中心) UCL(伦敦大学学院) LG AI Research(LG人工智能研究)

专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过形式化模式匹配为函数等价性,分析LLMs在组合任务中的泛化能力及其限制,揭示路径模糊性对模型性能的影响,并提出链式思维的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21053 2026-02-25 cs.CV 67%

OCR-Agent: Agentic OCR with Capability and Memory Reflection

OCR-Agent: 具有能力和记忆反思的代理OCR

Shimin Wen, Zeyu Zhang, Xingdou Bian, Hongjie Zhu, Lulu He, Layi Shama, Daji Ergu, Ying Cai

机构 * Southwest Minzu University(西南民族大学) AI Geeks

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract)

AI总结 OCR-Agent通过能力反思和记忆反思机制,提升VLMs的推理鲁棒性,实现更稳定的答案质量改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17097 2026-02-20 cs.SD 67%

AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing

AudioChat: 通过Transfusion Forcing实现统一的音频讲故事、编辑与理解

William Chen, Prem Seetharaman, Rithesh Kumar, Oriol Nieto, Shinji Watanabe, Justin Salamon, Zeyu Jin

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Adobe Research(Adobe研究) OpenAI. Work performed while at Adobe(OpenAI)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 AudioChat通过Transfusion Forcing实现音频故事的生成、编辑与理解,结合LLM工具调用和结构化推理提升多轮交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16455 2026-02-19 cs.CV 67%

Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing

视觉自校准:一种像素引导的准确图表解析范式

Jinsong Li, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港下的CPII) Shanghai Innovation Institute(上海创新研究院)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract)

AI总结 本文提出视觉自校准范式,通过像素引导提升图表解析的准确性,并构建了新的挑战性基准测试ChartP-Bench。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01623 2026-02-03 cs.CV 67%

Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?

Omni-Judge: 能否将 Omni-LLMs 用作文本条件音频视频生成的人类对齐裁判?

Susan Liang, Chao Huang, Filippos Bellos, Yolo Yunlong Tang, Qianxiang Shen, Jing Bi, Luchuan Song, Zeliang Zhang, Jason Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 Omni-Judge 评估 Omni-LLMs 是否能作为文本条件音频视频生成的人类对齐裁判,展现其在多模态评估中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01945 2026-02-03 cs.LG cs.AI cs.CL 67%

Agentic Policy Optimization via Instruction-Policy Co-Evolution

通过指令-策略共演进行代理策略优化

Han Zhou, Xingchen Wan, Ivan Vulić, Anna Korhonen

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Machine Learning Research Group, University of Oxford(牛津大学机器学习研究组)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 INSPO通过指令与策略的共演机制,动态优化指令以提升代理在多轮检索和推理任务中的性能,显著优于静态指令基线。

Comments 8 pages, 4 figures, 1 table (17 pages including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04012 2026-01-30 cs.CL cs.AI cs.LG 67%

EMSEdit: Efficient Multi-Step Meta-Learning-based Model Editing

EMSEdit: 基于多步元学习的高效模型编辑

Xiaopeng Li, Shasha Li, Xi Wang, Shezheng Song, Bin Ji, Shangwen Wang, Jun Ma, Xiaodong Liu, Mina Liu, Jie Yu

机构 * National University of Denfense Technology(国防科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EMSEdit通过多步反向传播和范数正则化提升模型编辑效率,在低数据和复杂编辑任务中表现优异。

Comments Accepted at WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14728 2026-01-22 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering

AQAScore: 通过音频问答评估文本到音频生成中的语义对齐

Chun-Yi Kuan, Kai-Wei Chang, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AQAScore通过音频问答评估文本到音频生成的语义对齐,利用大型语言模型的推理能力,有效捕捉语义不一致性。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18085 2026-01-22 cs.CL cs.AI cs.LG 67%

Temporal Relation Extraction in Clinical Texts: A Span-based Graph Transformer Approach

临床文本中的时间关系抽取:一种基于跨度的图变换器方法

Rochana Chaturvedi, Peyman Baghershahi, Sourav Medya, Barbara Di Eugenio

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GRAPHTREX方法,通过结合基于跨度的实体关系抽取、临床预训练语言模型和异构图变换器,提升临床文本中时间关系抽取的准确率和长距离关系识别能力。

Comments Introducing a novel method for joint extraction of medical events and temporal relations from free-text, leveraging clinical LPLMs and Heterogeneous Graph Transformers, achieving a 5.5% improvement over the previous state-of-the-art and up to 8.9% on long-range relations

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11637 2026-01-21 cs.CV 67%

Evaluating Self-Correcting Vision Agents Through Quantitative and Qualitative Metrics

通过定量和定性指标评估自我纠正的视觉代理

Aradhya Dixit

机构 * The Thørväld Group(Thørväld集团) Inria Paris-Rocquencourt(巴黎-罗克琴堡Inria) Rajiv Gandhi University Doimukh(拉贾·甘地大学多伊穆克) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室) The Kumquat Consortium(昆夸特联盟)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract)

AI总结 本文提出诊断微基准测试,通过量化和定性指标评估视觉代理的自我纠正能力,揭示语义漂移是主要瓶颈,并定义可重复的框架以提升多模态代理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07935 2026-01-14 cs.LG cs.AI cs.CL 67%

Towards Specialized Generalists: A Multi-Task MoE-LoRA Framework for Domain-Specific LLM Adaptation

迈向专业化的通用者:一种多任务MoE-LoRA框架用于领域特定LLM适应

Yuxin Yang, Aoxiong Zeng, Xiangquan Yang

机构 * Shanghai University(上海大学) East China Normal University(东华大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Med-MoE-LoRA框架,通过结合MoE与LoRA实现高效多任务领域适应,尤其适用于医学场景,有效解决领域知识获取与通用能力保留的难题。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05259 2026-01-12 cs.IR 67%

A Technical Report on the Second Place Solution for the CIKM 2025 AnalytiCup Competition

CIKM 2025 AnalytiCup竞赛第二名解决方案的技术报告

Haotao Xie, Ruilin Chen, Yicheng Wu, Zhan Zhao, Yuanyuan Liu

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出基于提示工程与任务分解的单模型框架,通过低秩适应提升多语言电商搜索相关性判断效率,取得竞赛优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01233 2026-01-06 cs.SE 67%

Atomizer: An LLM-based Collaborative Multi-Agent Framework for Intent-Driven Commit Untangling

Atomizer: 一种基于大语言模型的协作多智能体框架,用于意图驱动的复合提交解缠

Kangchen Zhu, Zhiliang Tian, Shangwen Wang, Mingyue Leng, Xiaoguang Mao

专题命中 复杂问题求解 :chain-of-thought(abstract);CoT(abstract)

AI总结 Atomizer通过意图导向的思考链策略和协作多智能体框架,有效解决复合提交解缠中的语义意图识别和多轮细化问题,提升解缠效果。

Comments Accepted by ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22650 2025-12-30 cs.LG cs.AI cs.CL 67%

Scaling Unverifiable Rewards: A Case Study on Visual Insights

扩展不可验证的奖励:视觉洞察的案例研究

Shuyu Gan, James Mooney, Pan Hao, Renxiang Wang, Mingyi Hong, Qianwen Wang, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Selective TTS框架,通过多阶段流程优化提升视觉洞察质量,实现计算预算固定下的性能提升。

Comments 32 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22009 2025-12-29 cs.CV 67%

iSHIFT: Lightweight Slow-Fast GUI Agent with Adaptive Perception

iSHIFT: 轻量级慢-快 GUI 代理与自适应感知

Sarthak Mehrotra, Sairam V C Rebbapragada, Mani Hemanth Reddy Bonthu, Vineeth N Balasubramanian

机构 * Indian Institute of Technology, Bombay(印度理工学院,孟买) Indian Institute of Technology, Hyderabad(印度理工学院,海得拉巴)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 iSHIFT是一种轻量级GUI代理,通过慢-快混合推理和灵活标记实现高效与精确的视觉交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20856 2025-12-25 cs.CL cs.AI cs.LG 67%

NVIDIA Nemotron 3: Efficient and Open Intelligence

NVIDIA Nemotron 3:高效且开放的智能

NVIDIA, :, Aaron Blakeman, Aaron Grattafiori, Aarti Basant, Abhibha Gupta, Abhinav Khattar, Adi Renduchintala, Aditya Vavre, Akanksha Shukla, Akhiad Bercovich, Aleksander Ficek, Aleksandr Shaposhnikov, Alex Kondratenko, Alexander Bukharin, Alexandre Milesi, Ali Taghibakhshi, Alisa Liu, Amelia Barton, Ameya Sunil Mahabaleshwarkar, Amir Klein, Amit Zuker, Amnon Geifman, Amy Shen, Anahita Bhiwandiwalla, Andrew Tao, Anjulie Agrusa, Ankur Verma, Ann Guan, Anubhav Mandarwal, Arham Mehta, Ashwath Aithal, Ashwin Poojary, Asif Ahamed, Asit Mishra, Asma Kuriparambil Thekkumpate, Ayush Dattagupta, Banghua Zhu, Bardiya Sadeghi, Barnaby Simkin, Ben Lanir, Benedikt Schifferer, Besmira Nushi, Bilal Kartal, Bita Darvish Rouhani, Boris Ginsburg, Brandon Norick, Brandon Soubasis, Branislav Kisacanin, Brian Yu, Bryan Catanzaro, Carlo del Mundo, Chantal Hwang, Charles Wang, Cheng-Ping Hsieh, Chenghao Zhang, Chenhan Yu, Chetan Mungekar, Chintan Patel, Chris Alexiuk, Christopher Parisien, Collin Neale, Cyril Meurillon, Damon Mosk-Aoyama, Dan Su, Dane Corneil, Daniel Afrimi, Daniel Lo, Daniel Rohrer, Daniel Serebrenik, Daria Gitman, Daria Levy, Darko Stosic, David Mosallanezhad, Deepak Narayanan, Dhruv Nathawani, Dima Rekesh, Dina Yared, Divyanshu Kakwani, Dong Ahn, Duncan Riach, Dusan Stosic, Edgar Minasyan, Edward Lin, Eileen Long, Eileen Peters Long, Elad Segal, Elena Lantz, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Tramel, Erick Galinkin, Erik Pounds, Evan Briones, Evelina Bakhturina, Evgeny Tsykunov, Faisal Ladhak, Fay Wang, Fei Jia, Felipe Soares, Feng Chen, Ferenc Galko, Frank Sun, Frankie Siino, Gal Hubara Agam, Ganesh Ajjanagadde, Gantavya Bhatt, Gargi Prasad, George Armstrong, Gerald Shen, Gorkem Batmaz, Grigor Nalbandyan, Haifeng Qian, Harsh Sharma, Hayley Ross, Helen Ngo, Herbert Hum, Herman Sahota, Hexin Wang, Himanshu Soni, Hiren Upadhyay, Huizi Mao, Huy C Nguyen, Huy Q Nguyen, Iain Cunningham, Ido Galil, Ido Shahaf, Igor Gitman, Ilya Loshchilov, Itamar Schen, Itay Levy, Ivan Moshkov, Izik Golan, Izzy Putterman, Jan Kautz, Jane Polak Scowcroft, Jared Casper, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jian Zhang, Jiaqi Zeng, Jie Lou, Jimmy Zhang, Jinhang Choi, Jining Huang, Joey Conway, Joey Guman, John Kamalu, Johnny Greco, Jonathan Cohen, Joseph Jennings, Joyjit Daw, Julien Veron Vialard, Junkeun Yi, Jupinder Parmar, Kai Xu, Kan Zhu, Kari Briski, Katherine Cheung, Katherine Luna, Keith Wyss, Keshav Santhanam, Kevin Shih, Kezhi Kong, Khushi Bhardwaj, Kirthi Shankar, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Lawrence McAfee, Laya Sleiman, Leon Derczynski, Li Ding, Lizzie Wei, Lucas Liebenwein, Luis Vega, Maanu Grover, Maarten Van Segbroeck, Maer Rodrigues de Melo, Mahdi Nazemi, Makesh Narsimhan Sreedhar, Manoj Kilaru, Maor Ashkenazi, Marc Romeijn, Marcin Chochowski, Mark Cai, Markus Kliegl, Maryam Moosaei, Matt Kulka, Matvei Novikov, Mehrzad Samadi, Melissa Corpuz, Mengru Wang, Meredith Price, Michael Andersch, Michael Boone, Michael Evans, Miguel Martinez, Mikail Khona, Mike Chrzanowski, Minseok Lee, Mohammad Dabbah, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Najeeb Nabwani, Natalie Hereth, Nave Assaf, Negar Habibi, Neta Zmora, Netanel Haber, Nicola Sessions, Nidhi Bhatia, Nikhil Jukar, Nikki Pope, Nikolai Ludwig, Nima Tajbakhsh, Nir Ailon, Nirmal Juluru, Nishant Sharma, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Omri Puny, Oren Tropp, Ouye Xie, Parth Chadha, Pasha Shamis, Paul Gibbons, Pavlo Molchanov, Pawel Morkisz, Peter Dykas, Peter Jin, Pinky Xu, Piotr Januszewski, Pranav Prashant Thombre, Prasoon Varshney, Pritam Gundecha, Przemek Tredak, Qing Miao, Qiyu Wan, Rabeeh Karimi Mahabadi, Rachit Garg, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Rich Harang, Rick Izzo, Rima Shahbazyan, Rishabh Garg, Ritika Borkar, Ritu Gala, Riyad Islam, Robert Hesse, Roger Waleffe, Rohit Watve, Roi Koren, Ruoxi Zhang, Russell Hewett, Russell J. Hewett, Ryan Prenger, Ryan Timbrook, Sadegh Mahdavi, Sahil Modi, Samuel Kriman, Sangkug Lim, Sanjay Kariyappa, Sanjeev Satheesh, Saori Kaji, Satish Pasumarthi, Saurav Muralidharan, Sean Narentharen, Sean Narenthiran, Seonmyeong Bak, Sergey Kashirsky, Seth Poulos, Shahar Mor, Shanmugam Ramasamy, Shantanu Acharya, Shaona Ghosh, Sharath Turuvekere Sreenivas, Shelby Thomas, Shiqing Fan, Shreya Gopal, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuoyang Ding, Siddharth Singh, Simeng Sun, Smita Ithape, Somshubra Majumdar, Soumye Singhal, Stas Sergienko, Stefania Alborghetti, Stephen Ge, Sugam Dipak Devare, Sumeet Kumar Barua, Suseella Panguluri, Suyog Gupta, Sweta Priyadarshi, Syeda Nahida Akter, Tan Bui, Teodor-Dumitru Ene, Terry Kong, Thanh Do, Tijmen Blankevoort, Tim Moon, Tom Balough, Tomer Asida, Tomer Bar Natan, Tomer Ronen, Tugrul Konuk, Twinkle Vashishth, Udi Karpas, Ushnish De, Vahid Noorozi, Vahid Noroozi, Venkat Srinivasan, Venmugil Elango, Victor Cui, Vijay Korthikanti, Vinay Rao, Vitaly Kurin, Vitaly Lavrukhin, Vladimir Anisimov, Wanli Jiang, Wasi Uddin Ahmad, Wei Du, Wei Ping, Wenfei Zhou, Will Jennings, William Zhang, Wojciech Prazuch, Xiaowei Ren, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Yigong Qin, Ying Lin, Yonatan Geifman, Yonggan Fu, Yoshi Subara, Yoshi Suhara, Yubo Gao, Zach Moshe, Zhen Dong, Zhongbo Zhu, Zihan Liu, Zijia Chen, Zijie Yan

机构 * NVIDIA

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NVIDIA推出的Nemotron 3系列模型通过混合Mamba-Transformer架构实现高效推理与大上下文长度,提供多种规模模型以满足不同应用场景需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12818 2025-12-16 cs.CL cs.AI cs.IR cs.LG 67%

Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects

事后诸葛亮:构建具有保留、回忆和反思能力的智能体记忆

Chris Latimer, Nicoló Boschi, Andrew Neeser, Chris Bartholomew, Gaurav Srivastava, Xuan Wang, Naren Ramakrishnan

机构 * The Washington Post(华盛顿邮报) Virginia Tech(弗吉尼亚理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Hindsight通过结构化内存架构提升智能体在长对话中的记忆与推理能力,显著提高多会话和开放领域问题的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23661 2025-12-16 cs.CV 67%

LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training

LLaVA-OneVision-1.5:面向民主化多模态训练的完全开放框架

Xiang An, Yin Xie, Kaicheng Yang, Wenkang Zhang, Xiuwei Zhao, Zheng Cheng, Yirui Wang, Songcen Xu, Changrui Chen, Didi Zhu, Chunsheng Wu, Huajie Tan, Chunyuan Li, Jing Yang, Jie Yu, Xiyao Wang, Bin Qin, Yumeng Wang, Zizhen Yan, Ziyong Feng, Ziwei Liu, Bo Li, Jiankang Deng

机构 * LLaVA-OneVision Community Contributors(LLaVA-OneVision社区贡献者)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 LLaVA-OneVision-1.5通过开放框架和高效训练方法实现了多模态模型的低成本高性能训练。

Comments LLaVA-OneVision-1.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05103 2025-12-15 cs.LG cs.AI cs.CL cs.CV 67%

TV2TV: A Unified Framework for Interleaved Language and Video Generation

TV2TV:一种用于交错语言和视频生成的统一框架

Xiaochuang Han, Youssef Emad, Melissa Hall, John Nguyen, Karthik Padthe, Liam Robbins, Amir Bar, Delong Chen, Michal Drozdzal, Maha Elbayad, Yushi Hu, Shang-Wen Li, Sreya Dutta Roy, Jakob Verbeek, XuDong Wang, Marjan Ghazvininejad, Luke Zettlemoyer, Emily Dinan

机构 * Meta FAIR

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00679 2025-12-15 cs.IR 67%

ProEx: A Unified Framework Leveraging Large Language Model with Profile Extrapolation for Recommendation

ProEx:一种利用大语言模型与特征外推的统一框架用于推荐

Yi Zhang, Yiwen Zhang, Yu Wang, Tong Chen, Hongzhi Yin

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 ProEx通过多维度资料外推提升推荐系统性能,利用链式推理构建多样化的用户和物品资料,以增强推荐效果。

Comments Accepted by KDD 2026 (First Cycle)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01132 2025-12-09 cs.LG cs.AI cs.CL 67%

A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning

多轮代理强化学习实践指南

Ruiyi Wang, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校) NVIDIA(英伟达)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多轮代理强化学习的训练方法,通过分析环境、奖励和策略三个支柱,总结出训练LLM代理的实践指南。

详情

展开后加载摘要…

URL PDF HTML 收藏