arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-04 至 2026-03-04 共收录 237 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 55 篇

2603.03142 2026-03-04 cs.CL cs.AI 73%

APRES: An Agentic Paper Revision and Evaluation System

APRES:一种代理论文修订与评估系统

Bingchen Zhao, Jenny Zhang, Chenxi Whitehouse, Minqi Jiang, Michael Shvartsman, Abhishek Charnalia, Despoina Magka, Tatiana Shavrina, Derek Dunfield, Oisin Mac Aodha, Yoram Bachrach

机构 * Meta Superintelligence Labs(Meta 超智能实验室) University of Edinburgh(爱丁堡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 APRES利用大型语言模型改进论文质量,通过评估标准提升引用预测,79%的专家更喜欢修订后的论文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02775 2026-03-04 cs.CL cs.LG 73%

From Solver to Tutor: Evaluating the Pedagogical Intelligence of LLMs with KMP-Bench

从求解器到导师:通过KMP-Bench评估LLM的教育智能

Weikang Shi, Houxing Ren, Junting Pan, Aojun Zhou, Ke Wang, Zimu Lu, Yunqiao Yang, Yuxuan Hu, Linda Wei, Mingjie Zhan, Hongsheng Li

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出KMP-Bench评估LLM的教育智能,通过多轮对话和技能测试揭示LLM在教学原则应用上的不足,并展示基于教育丰富数据集的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19517 2026-03-04 cs.AI cs.CE cs.CL cs.CV 73%

Classroom Final Exam: An Instructor-Tested Reasoning Benchmark

教室期末考试:一个由教师测试的推理基准

Chongyang Gao, Diji Yang, Shuyan Zhou, Xichen Yan, Luchuan Song, Shuo Li, Kezhen Chen

机构 * Northwestern University(西北大学) UC Santa Cruz(加州大学圣克鲁兹分校) Duke University(杜克大学) University of Birmingham(伯明翰大学) University of Rochester(罗切斯特大学) Analogy AI, Inc.(Analogy AI 公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CFE-Bench是一个由教师测试的多模态推理基准,用于评估大语言模型在STEM领域中的推理能力,发现前沿模型在多步骤解决方案中存在中间状态推导和保持的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08032 2026-03-04 cs.CL cs.LG 73%

Verifying the Robustness of Automatic Credibility Assessment

验证自动可信度评估的鲁棒性

Piotr Przybyła, Alexander Shvets, Horacio Saggion

机构 * Universitat Pompeu Fabra(庞培法布拉大学) Institute of Computer Science, Polish Academy of Sciences(波兰科学院计算机科学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究验证了自动可信度评估模型对多种攻击技术的鲁棒性,发现大型语言模型更易受攻击,提出BODEGA基准用于评估内容管理中的虚假信息检测。

Journal ref Nat. lang. process. 31 (2025) 1134-1162

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02222 2026-03-04 cs.LG cs.AI 73%

MedCalc-Bench Doesn't Measure What You Think: A Benchmark Audit and the Case for Open-Book Evaluation

MedCalc-Bench 并未衡量你所想的:一项基准审计与开放书考试的案例

Artus Krohn-Grimberghe

机构 * MedCalc

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 MedCalc-Bench的基准审计揭示其主要衡量公式记忆和算术精度,而非临床推理,通过开放书提示显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08939 2026-03-04 cs.LG cs.CL 73%

TransactionGPT

交易GPT

Yingtong Dou, Zhimeng Jiang, Tianyi Zhang, Mingzhi Hu, Zhichao Xu, Shubham Jain, Uday Singh Saini, Xiran Fan, Jiarui Sun, Menghai Pan, Junpeng Wang, Xin Dai, Liang Wang, Chin-Chia Michael Yeh, Yujie Fan, Yan Zheng, Vineeth Rakesh, Huiyuan Chen, Guanchu Wang, Mangesh Bendre, Zhongfang Zhuang, Xiaoting Li, Prince Aboagye, Vivian Lai, Minghua Xu, Hao Yang, Yiwei Cai, Mahashweta Das, Yuzhong Chen

专题命中 评测与基准 :LLM(abstract);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 TransactionGPT是一种专为支付交易数据设计的基础模型,通过3D-Transformer架构提升交易轨迹理解和生成能力,并在异常检测和未来交易预测中表现优异。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22641 2026-03-04 cs.CL cs.AI cs.HC 73%

Death of the Novel(ty): Beyond n-Gram Novelty as a Metric for Textual Creativity

新型词的终结:超越n-gram新颖性作为文本创造力的度量

Arkadiy Saakyan, Najoung Kim, Smaranda Muresan, Tuhin Chakrabarty

机构 * Columbia University(哥伦比亚大学) Boston University(波士顿大学) Stony Brook University(石溪大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了n-gram新颖性作为文本创造力度量的局限性,发现其与专家判断的创造力正相关,但高新颖性表达未必具有创造力,且LLM在识别非实用表达方面表现欠佳。

Comments ICLR 2026 Camera Ready. 30 pages, 11 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05334 2026-03-04 cs.CL cs.IR cs.LG 73%

Search Arena: Analyzing Search-Augmented LLMs

Search Arena: 分析增强搜索的大型语言模型

Mihran Miroyan, Tsung-Han Wu, Logan King, Tianle Li, Jiayi Pan, Xinyan Hu, Wei-Lin Chiang, Anastasios N. Angelopoulos, Trevor Darrell, Narges Norouzi, Joseph E. Gonzalez

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 Search Arena 是一个大规模众包数据集,用于分析增强搜索的LLMs,揭示用户偏好受引用数量影响,并发现不同来源的可靠性差异。

Comments Accepted to ICLR 2026. Code: https://github.com/lmarena/search-arena. Dataset: https://huggingface.co/datasets/lmarena-ai/search-arena-24k

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00447 2026-03-04 cs.AI 70%

The MERIT Dataset: Modelling and Efficiently Rendering Interpretable Transcripts

MERIT数据集:模型与高效可解释 transcripts 的渲染

I. de Rodrigo, A. Sanchez-Cuadrado, J. Boal, A. J. Lopez-Lopez

机构 * Institute for Research in Technology, ICAI School of Engineering, Comillas Pontifical University(技术研究 institute,ICAI 工程学院,科利马天主教大学)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 MERIT数据集通过多模态信息和偏见控制,为训练视觉丰富文档理解模型提供挑战性资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02684 2026-03-04 cs.CL cs.SI 70%

HateMirage: An Explainable Multi-Dimensional Dataset for Decoding Faux Hate and Subtle Online Abuse

HateMirage: 一个可解释的多维数据集用于解码虚假仇恨与微妙的在线虐待

Sai Kartheek Reddy Kasu, Shankar Biradar, Sunil Saumya, Md. Shad Akhtar

机构 * Indian Institute of Information Technology Dharwad(印度信息技术学院达尔瓦德) Manipal Institute of Technology, Manipal Academy of Higher Education(曼普及高等教育学院技术学院) Indraprastha Institute of Information Technology Delhi(印度普拉斯塔信息技术学院德里)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 HateMirage 是一个用于解码虚假仇恨与微妙在线虐待的多维数据集,通过多维解释框架提升仇恨言论的可解释性研究。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02586 2026-03-04 cs.AI 70%

LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges

LiveAgentBench: 104个现实挑战上代理系统全面评估基准

Hao Li, Huan Wang, Jinjie Gu, Wenjie Wang, Chenyi Zhuang, Sikang Bian

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LiveAgentBench通过104个现实挑战全面评估代理系统,采用社会感知驱动的数据生成方法,提供374个任务用于验证和测试,揭示模型实际性能并识别改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00931 2026-03-04 cs.CV 67%

Learning to Weigh Waste: A Physics-Informed Multimodal Fusion Framework and Large-Scale Dataset for Commercial and Industrial Applications

学习称重垃圾:一种融合多模态的物理引导框架和大规模数据集用于商业和工业应用

Md. Adnanul Islam, Wasimul Karim, Md Mahbub Alam, Subhey Sadi Rahman, Md. Abdur Rahman, Arefin Ittesafun Abian, Mohaimenul Azam Khan Raiaan, Kheng Cher Yeo, Deepika Mathur, Sami Azam

机构 * Department of Computer Science and Engineering, United International University(计算机科学与工程系,国际大学) Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory(应用人工智能与智能系统实验室) Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) Faculty of Science and Technology, Charles Darwin University(科学与技术学院,查尔斯达尔文大学) Faculty of Arts and Society, Charles Darwin University(艺术与社会学院,查尔斯达尔文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种融合多模态的物理引导框架和大规模数据集,用于准确估计商业和工业垃圾的重量,通过结合视觉和物理信息提升预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02329 2026-03-04 cs.CV 67%

HAMMER: Harnessing MLLM via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding

HAMMER: 通过跨模态整合利用大语言模型进行意图驱动的3D affordance grounding

Lei Yao, Yong Chen, Yuejiao Su, Yi Wang, Moyun Liu, Lap-Pui Chau

机构 * The Hong Kong Polytechnic University(香港理工大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 HAMMER通过跨模态整合多模态大语言模型,实现意图驱动的3D affordance grounding,提升3D表示的准确性和鲁棒性。

Comments Accepted by CVPR 2026. Project Page: https://rayyoh.github.io/Hammer

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20346 2026-03-04 cs.CR cs.AI cs.LG 62%

Multimodal Multi-Agent Ransomware Analysis Using AutoGen

基于AutoGen的多模态多智能体勒索软件分析

Asifullah Khan, Aimen Wadood, Mubashar Iqbal, Umme Zahoora

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于AutoGen的多模态多智能体框架,通过融合静态、动态和网络信息,提升勒索软件分类的准确性和稳定性。

Comments 46 pages, 11 figures and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03278 2026-03-04 cs.RO cs.AI cs.CV 57%

Tether: Autonomous Functional Play with Correspondence-Driven Trajectory Warping

Tether: 基于对应驱动轨迹扭曲的自主功能性玩耍

William Liang, Sam Wang, Hung-Ju Wang, Osbert Bastani, Yecheng Jason Ma, Dinesh Jayaraman

机构 * University of Pennsylvania(宾夕法尼亚大学) University of California, Berkeley(加州大学伯克利分校) Dyna Robotics(Dyna机器人技术)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 Tether通过基于对应驱动的轨迹扭曲,实现从少量演示开始的自主多任务玩耍,生成高质量数据集并提升模仿策略性能。

Comments International Conference on Learning Representations (ICLR), 2026. Project website and code: https://tether-research.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03134 2026-03-04 cs.CL 57%

UniSkill: A Dataset for Matching University Curricula to Professional Competencies

UniSkill: 一个用于将大学课程与专业能力匹配的数据集

Nurlan Musazade, Joszef Mezei, Mike Zhang

机构 * Åbo Akademi University, Finland(阿博阿卡迪米大学,芬兰) University of Copenhagen, Denmark(哥本哈根大学,丹麦) Pioneer Centre for AI, Denmark(人工智能先锋中心,丹麦)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 UniSkill 数据集通过发布手动标注和合成数据,旨在解决大学课程与专业能力匹配中的数据稀缺问题,并通过 BERT 模型实现了 87% 的 F1 分数,证明了该任务的可行性。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02243 2026-03-04 cs.CL 57%

AccurateRAG: A Framework for Building Accurate Retrieval-Augmented Question-Answering Applications

AccurateRAG:构建准确检索增强型问答应用的框架

Linh The Nguyen, Chi Tran, Dung Ngoc Nguyen, Van-Cuong Pham, Hoang Ngo, Dat Quoc Nguyen

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 AccurateRAG通过高效流程和本地构建能力,在问答任务中实现更高性能和新状态的SOTA表现。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18560 2026-03-04 cs.SE cs.AI 57%

WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality

WebDevJudge: 评估 (M)LLMs 作为 Web 开发质量的批评者

Chunyang Li, Yilun Zheng, Xinting Huang, Tianqing Fang, Jiahao Xu, Lihui Chen, Yangqiu Song, Han Hu

机构 * Tencent AI Lab(腾讯AI实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 WebDevJudge 提出了一种评估 LLM 作为 Web 开发质量批评者的基准,揭示了 LLM 与人类专家之间的显著差距,指出了模型在功能等价性识别、任务可行性验证和偏见缓解方面的根本性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03533 2026-03-04 cs.CL 57%

Go-Browse: Training Web Agents with Structured Exploration

Go-Browse: 通过结构化探索训练网络代理

Apurva Gandhi, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 Go-Browse通过结构化探索方法,利用大规模网络环境数据训练代理,提升任务解决成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14632 2026-03-04 cs.CL 57%

Diverging Preferences: When do Annotators Disagree and do Models Know?

分歧偏好:标注者何时分歧以及模型是否知道?

Michael JQ Zhang, Zhilin Wang, Jena D. Hwang, Yi Dong, Olivier Delalleau, Yejin Choi, Eunsol Choi, Xiang Ren, Valentina Pyatkin

机构 * New York University(纽约大学) Allen Institute for Artificial Intelligence(人工智能研究院) NVIDIA(NVIDIA公司) University of Washington(华盛顿大学) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文研究了标注者分歧的来源,发现任务不明确等因素导致大多数分歧,并提出方法以减轻其在LLM评估和训练中的影响。

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02790 2026-03-04 cs.CV 50%

Designing UNICORN: a Unified Benchmark for Imaging in Computational Pathology, Radiology, and Natural Language

设计UNICORN:面向医学成像的统一基准测试

Michelle Stegeman, Lena Philipp, Fennie van der Graaf, Marina D'Amato, Clément Grisi, Luc Builtjes, Joeran S. Bosma, Judith Lefkes, Rianne A. Weber, James A. Meakin, Thomas Koopman, Anne Mickan, Mathias Prokop, Ewoud J. Smit, Geert Litjens, Jeroen van der Laak, Bram van Ginneken, Maarten de Rooij, Henkjan Huisman, Colin Jacobs, Francesco Ciompi, Alessa Hering

专题命中 评测与基准 :foundation model(abstract)

AI总结 UNICORN是一个面向医学成像的统一基准测试,旨在通过标准化评估框架系统评估医学基础模型的跨模态和多任务泛化能力。

Comments This paper describes the dataset and design of the UNICORN challenge and provides the link to Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16654 2026-03-04 cs.CV 50%

Are VLMs Ready for Lane Topology Awareness in Autonomous Driving?

视觉-语言模型是否准备好在自动驾驶中具备车道拓扑意识?

Xin Chen, Jia He, Maozheng Li, Dongliang Xu, Tianyu Wang, Yixiao Chen, Zhixin Lin, Yue Yao

机构 * Shandong University(山东大学) MBZUAI Sems

专题命中 评测与基准 :language model(abstract)

AI总结 本文评估了VLMs在自动驾驶中理解道路拓扑结构的能力,发现尽管闭源模型在部分任务表现良好,但空间推理仍是其主要瓶颈,且模型规模和推理令牌数量对性能有显著影响。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02294 2026-03-04 eess.IV cs.CV 50%

Loss Design and Architecture Selection for Long-Tailed Multi-Label Chest X-Ray Classification

长尾多标签胸片分类中的损失设计与架构选择

Nikhileswara Rao Sulake

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Rajiv Gandhi University of Knowledge Technologies(拉贾戈丁德知识技术大学) Gandhi University of Knowledge Technologies(戈丁德知识技术大学)

专题命中 评测与基准 :post-training(abstract)

AI总结 本文提出了一种针对长尾多标签胸片分类的损失设计和架构选择方法,通过实验验证LDAM-DRW在稀有类识别中的优越性,并展示了ConvNeXt-Large在性能上的最佳表现。

Comments This paper would be a part of the CXR Long Tail Challenge in ISBI 2026. This is my team report of it's work during the challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23141 2026-03-04 cs.CV 50%

Earth-Agent: Unlocking the Full Landscape of Earth Observation with Agents

Earth-Agent: 解锁地球观测的全貌与潜力

Peilin Feng, Zhutao Lv, Junyan Ye, Xiaolei Wang, Xinjie Huo, Jinhua Yu, Wanghan Xu, Wenlong Zhang, Lei Bai, Conghui He, Weijia Li

专题命中 评测与基准 :LLM(abstract)

AI总结 Earth-Agent是一种结合RGB和光谱数据的代理框架,通过多模态工具生态系统实现跨模态、多步骤推理,提升地球观测分析的科学性和应用潜力。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 42 篇

2407.16893 2026-03-04 cs.CY cs.AI cs.CL 92%

The Price of Prompting: Profiling Energy Use in Large Language Models Inference

提示的成本:大型语言模型推理中能源使用的 profiling

Erik Johannes Husom, Arda Goknil, Lwin Khin Shar, Sagar Sen

机构 * SINTEF Singapore Management University(新加坡管理大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

AI总结 本文提出MELODI框架,用于分析大型语言模型推理过程中的能源消耗,通过构建数据集研究提示属性与能源支出的关系,为可持续LLM部署提供基础工具。

Comments 11 pages, 5 figures. Submitted to NeurIPS 2024. The released code and dataset are available at https://github.com/ejhusom/MELODI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05619 2026-03-04 cs.CR cs.LG 90%

LiteLMGuard: Seamless and Lightweight On-Device Prompt Filtering for Safeguarding Small Language Models against Quantization-induced Risks and Vulnerabilities

LiteLMGuard: 无缝且轻量级的设备端提示过滤,用于保护小型语言模型免受量化引发的风险和漏洞

Kalyan Nakka, Jimmy Dani, Ausmit Mondal, Nitesh Saxena

机构 * SPIES Research Lab, Dept. of CSE, Texas A&M University(SPIES研究实验室,计算机科学与工程系,德克萨斯大学阿马尔科分校)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

AI总结 LiteLMGuard通过设备端实时提示过滤,有效保护小型语言模型免受量化带来的安全风险。

Comments 18 pages, 19 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08646 2026-03-04 cs.LG cs.AI cs.CL stat.ML 90%

Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy

通过推理时间激活能量缓解对齐大语言模型中的过度拒绝

Eric Hanchen Jiang, Weixuan Ou, Run Liu, Shengyuan Pang, Guancheng Wan, Ranjie Duan, Wei Dong, Kai-Wei Chang, XiaoFeng Wang, Ying Nian Wu, Xinfeng Li

机构 * UCLA(加州大学洛杉矶分校) Alibaba Cloud Computing(阿里云计算) SJTU(上海交通大学) Alibaba Group(阿里巴巴集团) NTU(国立科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过能量景观引导框架,提升大语言模型的安全性并减少虚假拒绝,实验显示在ORB-H基准上合规性显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18671 2026-03-04 cs.AI cs.CL 90%

Spilled Energy in Large Language Models

大语言模型中的能量溢出

Adrian Robert Minut, Hazem Dewidar, Iacopo Masi

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出了一种无需训练的基于能量的模型方法,用于检测大语言模型中的幻觉和错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03215 2026-03-04 cs.CL cs.LG 90%

Cache-to-Cache: Direct Semantic Communication Between Large Language Models

缓存到缓存:大型语言模型之间的直接语义通信

Tianyu Fu, Zihan Min, Hanling Zhang, Jichao Yan, Guohao Dai, Wanli Ouyang, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence AI The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) SLAI Shanghai AI Laboratory(上海人工智能实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 缓存到缓存通过直接语义通信提升大型语言模型的性能和效率,实现比文本通信更高的准确率和更低的延迟。

Comments Published in ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05612 2026-03-04 cs.LG cs.AI 90%

Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle

Shuffle-R1: 通过数据导向的动态洗牌提升多模态大语言模型的强化学习框架

Linghao Zhu, Yiran Guan, Dingkang Liang, Jianzhong Ju, Zhenbo Luo, Bin Qin, Jian Luan, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus, Xiaomi Inc.(MiLM Plus,小米公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 Shuffle-R1通过动态洗牌和轨迹采样提升多模态大语言模型的强化学习效率,实现更高效的训练效果。

Comments This paper has been accepted by ICLR 2026. Conference link: https://iclr.cc/virtual/2026/poster/10007559 OpenReview link: https://openreview.net/forum?id=mYP33u1QBK Project page at: https://xenozlh.github.io/Shuffle-R1/

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏