arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7583 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7583 篇

2605.05686 2026-07-15 cs.AI 版本更新 57%

Attractor Geometry of Transformer Memory: From Conflict Arbitration to Confident Hallucination

Transformer记忆的吸引子几何:从冲突仲裁到自信 hallucination

Qiyao Liang, Risto Miikkulainen, Ila Fiete

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Texas Austin(德克萨斯大学奥斯汀分校) Cognizant(Cognizant公司)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究Transformer记忆中冲突与hallucination的几何机制,揭示吸引子基底在隐藏状态空间中的作用,通过合成任务验证几何边界在区分正确回忆与hallucination中的有效性。

Comments Inadvertent premature posting before full approval of all listed co-authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11698 2026-07-14 cs.CR cs.AI 新提交 57%

Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming

智能体攻击智能体:用于生产智能体红队测试的自动研究

Xutao Mao, Xiang Zheng, Cong Wang

机构 * City University of Hong Kong(香港城市大学)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.AI

AI总结 研究生产型语言模型智能体的自动化红队测试,提出AHA可证伪发现循环,通过该循环构建漏洞概念图。在Claude Code和Codex上测试,发现跨模型和智能体的可重复使用漏洞核心,生成的VCG为安全团队提供可审计工件,提升测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22378 2026-07-14 cs.SD cs.AI cs.MM eess.AS 57%

Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM Approach

零努力图像到音乐生成:一种可解释的基于RAG的视觉语言模型方法

Zijian Zhao, Dian Jin, Zijing Zhou

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong Polytechnic University(香港理工大学) The University of Hong Kong(香港大学) The Hong Kong University of Science(香港科学大学) The Hong Kong Polytechnic University Hong Kong China(香港理工大学香港中国) The University of Hong Kong Hong Kong China(香港大学香港中国)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文提出一种基于RAG的视觉语言模型方法,实现图像到音乐生成,通过ABC记谱法连接文本与音乐模态,并利用多模态检索增强生成和自反思技术,提供高可解释性且低计算成本的音乐生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09544 2026-07-13 cs.CV cs.LG 新提交 57%

The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs

计数存在但未对齐:理解和纠正视觉语言模型中的计数失败

Ahmed Oumar El-Shangiti, Abzal Nurgazy, Hilal AlQuabeh, Nikolai Rozanov, Kentaro Inui

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Imperial College London(伦敦帝国学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 研究视觉语言模型计数失败问题,通过对VLM激活进行探测训练及分析,发现其虽常编码正确计数但输出错误,提出探测器引导的自校正方法,在不更新参数时提高计数准确率,揭示内部知识与模型输出差距并提供改进工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24819 2026-07-13 cs.RO cs.CV cs.LG 57%

Bi-Manual Joint Camera Calibration and Scene Representation

双臂联合相机标定与场景表示

Haozhan Tang, Tianyi Zhang, Matthew Johnson-Roberson, Weiming Zhi

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) College of Connected Computing, Vanderbilt University(范德比大学连接计算学院)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 本研究提出Bi-JCR框架,通过3D基础模型实现双臂机器人无需标记的联合标定与共享空间的统一3D表示,提升双臂协调任务的鲁棒性和应用性。

Journal ref Proceedings of the IEEE International Conference on Robotics and Automation (ICRA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08741 2026-07-10 cs.GR cs.CV cs.LG cs.RO 新提交 57%

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

ARDY:用于交互式人体运动生成的具有混合表示的自回归扩散

Kaifeng Zhao, Mathis Petrovich, Haotian Zhang, Tingwu Wang, Siyu Tang, Davis Rempe

机构 * NVIDIA(英伟达) ETH Zürich(苏黎世联邦理工学院)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.LG

AI总结 研究旨在解决交互式应用中人体运动生成问题,提出ARDY框架,采用混合表示和两阶段自回归变压器去噪器,能通过在线文本提示和运动学约束实现高保真运动生成,经评估验证了有效性和实用性。

Comments ACM Transactions on Graphics (SIGGRAPH 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18419 2026-07-08 cs.CV cs.AI 版本更新 57%

Geometry-Aware Uncertainty Coresets for Robust Visual In-Context Learning in Histopathology

面向几何的不确定性聚类用于病理学中鲁棒的视觉上下文学习

Franciskus Xaverius Erick, Johanna Paula Müller, Bernhard Kainz

机构 * FAU Erlangen-Nürnberg, Erlangen, DE(埃尔兰根-纽伦堡大学) Department of Computing, Imperial College London, London, UK(伦敦帝国理工学院计算机系)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文提出GAUC,一种无需训练的聚类选择方法,直接在预训练的多模态嵌入空间中操作,通过优化三个目标提升视觉上下文学习的鲁棒性、准确性和校准性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03806 2026-07-07 eess.AS cs.AI eess.SP 新提交 57%

Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

探测CLAP音频嵌入中的低层声学属性编码

Héctor Martel, Joe Hennessy-Priest, Taemin Cho

机构 * BandLab Technologies(BandLab技术公司)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 该研究通过探测框架分析CLAP音频嵌入,探究混响、响度等三类基础声学属性的编码方式,发现多数属性可恢复,存在线性与非线性两种编码模式,还验证了跨模态一致性。

Comments Accepted to DAFx 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04729 2026-07-07 cs.CR cs.AI cs.SE 新提交 57%

RustMizan: A Compilable, Contamination-Aware Benchmarking Framework for Rust Vulnerabilities

RustMizan:用于Rust漏洞的可编译、污染感知基准测试框架

Tarek Elsayed, Shiping Yang, Eunsong Koh, Sanika Goyal, Vincent Huang, Paul Ngo, Nathan Young, Mohammad Omidvar Tehrani, Alvyn Kang, Arnell Kang, Zeyu Chen, Angélica Moreira, Xuan Feng, Angel X. Chang, Nick Sumner, Steven Y. Ko

机构 * Simon Fraser University(西蒙弗雷泽大学) Trinity University(特里尼蒂大学) Microsoft Research(微软研究院) Amii(阿米国际)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.AI

AI总结 针对现有Rust漏洞分析基准不足,介绍RustMizan框架,含可编译代码变体及注释,用配对突变框架测试,给出不同模型在该框架下的测试结果。

Comments 36 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03994 2026-07-07 cs.CV cs.AI 新提交 57%

Full Glyph Images Beat Token Embeddings: A Controlled Study for Transformers

完整字形图像胜过词元嵌入:Transformer的对照研究

Shuyang Xiang, Hao Guan

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 挑战用离散词元嵌入表示文本,用字符序列光栅化图像经视觉编码器处理替代,构建双分支框架对比,发现基于视觉模型性能优于基线,揭示优势条件及跨脚本差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03973 2026-07-07 cs.LG 新提交 57%

MANCE: Manifold Aware Concept Erasure

MANCE:流形感知概念擦除

Matan Avitan, Yoav Goldberg, Yanai Elazar

机构 * Bar-Ilan University(巴伊兰大学) Allen Institute for Artificial Intelligence(艾伦人工智能研究所)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 提出流形约束假设,在新概念擦除方法MANCE中实例化,利用分类器信号迭代更新表示,投影概念移除更新到估计流形,经多设置评估,其改进泄漏结果,MANCE+和MANCE++有更好权衡,MANCE++达非线性概念擦除最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03903 2026-07-07 cs.LG 新提交 57%

CDCP: Conditional Diffusion Model with Contextual Prompts for Multi-task Offline Safe Reinforcement Learning

CDCP:用于多任务离线安全强化学习的带上下文提示的条件扩散模型

Jiayi Guan, Tianle Zhang, Li Shen, Ruiqi Zhang, Ao Zhou, Lusong Li, Guai Chen, Mengjie Li, Alois Knoll, Xiaodong He, Changjun Jiang

机构 * Tongji University(同济大学) JD Explore Academy(京东探索研究院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院) Berkeley AI Research Lab, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室) Technical University of Munich(慕尼黑工业大学)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.LG

AI总结 针对多任务离线安全强化学习面临的挑战,提出CDCP模型。通过重新审视需求建立目标,用扩散模型转化问题,设计策略并引入新方法,提升性能与安全性,提供灵活成本约束解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03731 2026-07-07 cs.HC cs.AI 新提交 57%

CoGen3D: An Agentic Human-AI Co-Design Pipeline for 3D Asset Generation for Virtual Reality

CoGen3D:用于虚拟现实3D资产生成的智能人机协同设计管道

Weiwei Jiang, Wanyu He, Zheyu Tan, Zheyuan Kuang, Difeng Yu, Shinobu Hasegawa, Sven Mayer, Zhanna Sarsenbayeva

机构 * Nanjing University of Information Science and Technology(南京信息工程大学) Japan Advanced Institute of Science and Technology(日本科学技术大学) The University of Sydney(悉尼大学) University of Copenhagen(哥本哈根大学) TU Dortmund University(多特蒙德技术大学) Research Center Trustworthy Data Science and Security(可信数据科学与安全研究中心)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.AI

AI总结 研究针对虚拟现实3D资产创作需建模专业知识的问题,引入CoGen3D智能人机协同设计管道,经用户研究评估,发现其可促进创作、改变情感反应,推动创作从技术执行转向协作空间设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31422 2026-07-07 cs.AI 新提交 57%

Ask the World Before Acting: Environment Probing for Calibrated Agent World Models

行动前先询问世界:预算受限的环境探测用于世界模型校准

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 知识编辑与模型理解 :language agent(abstract);分类 cs.AI

AI总结 提出预算受限的环境探测算子,通过结构化信念表在行动前校准世界模型,减少长期任务中的终端误差。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03750 2026-07-07 cs.LG cs.CE cs.CV eess.IV 版本更新 57%

GlaBoost: A Multimodal Structured Framework for Glaucoma Risk Stratification

GlaBoost:用于青光眼风险分层的多模态结构化框架

Cheng Huang, Zeyu Han, Weizheng Xie, Karanjit Kooner, Tsengdar Lee, Jui-Kai Wang, Jia Zhang

机构 * Department of Computer Science, Southern Methodist University(计算机科学系,南方 Methodist 大学) Department of Ophthalmology, UT Southwestern Medical Center(眼科学系,UT 南方医学中心) High Performance Computing Program, National Aeronautics and Space Administration(高性能计算计划,国家航空航天局)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 研究针对青光眼检测,提出多模态梯度提升框架GlaBoost,统一眼底图像嵌入、文本评估及生物标志物三信号预测风险,融合后用增强XGBoost分类,性能超基线且可解释。

Comments Accepted by IEEE 48th EMBC (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13438 2026-07-07 cs.CV cs.LG 57%

Explainable Concept Generation through Vision-Language Preference Learning for Understanding Neural Networks' Internal Representations

通过视觉-语言偏好学习实现可解释的概念生成以理解神经网络的内部表示

Aditya Taparia, Som Sagar, Ransalu Senanayake

专题命中 知识编辑与模型理解 :preference optimization(abstract);分类 cs.LG

AI总结 本文提出通过视觉-语言偏好学习生成概念图像集,解决传统方法需手动收集概念图像集的不足,提高神经网络内部表示理解的效率和可靠性。

Comments 28 pages, 31 figures

Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML 2025), PMLR 267:59154-59181, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01303 2026-07-03 cs.CV cs.AI 新提交 57%

CPG-PAD: Concept-Informed Prompts Guided Presentation Attack Detection

CPG-PAD: 概念引导提示的呈现攻击检测

Haoyuan Zhang, Xiangyu Zhu, Li Gao, Ajian Liu, Siran Peng, Zhen Lei

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) China Mobile Financial Technology Co., Ltd.(中移动金融科技有限公司) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港创新研究院人工智能与机器人创新中心) School of Computer Science and Engineering, the Faculty of Innovation Engineering, Macau University of Science and Technology(澳门科技大学创新工程学院计算机科学与工程学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 提出概念引导提示的呈现攻击检测框架,通过可解释AI发现攻击相关视觉概念并注入提示空间,提升跨域泛化能力,在多个基准数据集上达到最优。

Comments Accepted by IEEE Transactions on Information Forensics & Security (TIFS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07820 2026-07-03 cs.CL 57%

Reference Games as a Testbed for the Alignment of Model Uncertainty and Clarification Requests

参考游戏作为模型不确定性与澄清请求对齐的测试平台

Manar Ali, Judith Sieker, Sina Zarrieß, Hendrik Buschmeier

机构 * Digital Linguistics Lab(数字语言实验室) Computational Linguistics Group(计算语言学小组)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 本文通过参考游戏测试语言模型在不确定性识别与澄清请求表达上的能力,发现模型在简单任务中难以准确识别自身不确定性并转化为澄清行为。

Comments Accepted at GEM@ACL 2026, the 5th Generation, Evaluation & Metrics Workshop

Journal ref Proceedings of the Fifth Workshop on Generation, Evaluation and Metrics (GEM 2026), pp. 990-998

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00958 2026-07-02 cs.LG 新提交 57%

LeNEPA: No-Augmentation Next-Latent Prediction for Time-Series Representation Learning

LeNEPA:无增强的下一潜在预测用于时间序列表示学习

Alexander Chemeris, Ming Jin, Randall Balestriero

机构 * Langotime South Africa(Langotime南非) Griffith University Australia(澳大利亚格里菲斯大学) Brown University United States(美国布朗大学)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 提出LeNEPA,一种无需数据增强的下一潜在预测架构,通过SIGReg正则化和轻量投影空间,在固定配方测试中跨数据集保持性能,优于ECG调优的JEPA。

Comments 9 pages, 4 figures, 6 tables; accepted by the 12th Mining and Learning from Time Series (KDD MILETS 2026); source code and artifacts: https://github.com/langotime/lenepa-milets-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00777 2026-07-02 cs.SD cs.LG 新提交 57%

Evaluating Pretrained Music Embeddings for Cross-Performance Jazz Standard Recognition

评估预训练音乐嵌入在跨演奏爵士标准曲识别中的表现

Çağrı Eser

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 研究利用预训练音乐嵌入进行跨演奏爵士标准曲识别,对比从头训练的谐波CNN基线,发现预训练嵌入在top-k结果上更优但对演奏者身份敏感,轻量对比投影可部分缓解。

Comments 6 pages, 2 figures, 4 tables. Accepted to the ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23164 2026-07-02 cs.LG 版本更新 57%

MetaOthello: A Controlled Study of Multiple World Models in Transformers

MetaOthello: Transformer中多个世界模型的控制研究

Aviral Chawla, Galen Hall, Juniper Lovato

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 通过引入共享语法但规则或分词不同的Othello变体套件,训练小型GPT处理混合数据,发现Transformer不划分容量为孤立子模型,而是收敛于跨变体因果转移的共享棋盘状态表示。

Comments Camera-ready version. Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32016 2026-07-01 cs.LG 新提交 57%

FedLAB: Traceable Semantic Codebooks for Federated Multimodal Graph Foundation Learning

FedLAB: 面向联邦多模态图基础学习的可追踪语义码本

Zekai Chen, Kairui Yang, Xuaner Chen, Xunkai Li, Xun Wu, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 提出FedLAB框架,通过类型化分层码本组织模态证据、节点语义和拓扑上下文,实现联邦多模态图学习中的可追踪语义,在10个基准和6个下游任务上提升达7.53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30498 2026-06-30 cs.CV cs.AI 57%

On the Faithfulness of Post-Hoc Concept Bottleneck Models

事后概念瓶颈模型的忠实性研究

Laines Schmalwasser, Jan Blunk, Niklas Penzel, Julia Niebling, Joachim Denzler

机构 * Institute of Data Science, German Aerospace Center(数据科学研究所,德国航空航天中心) Computer Vision Group Jena, Friedrich Schiller University Jena(贾恩计算机视觉小组,弗里德里希·席勒大学贾恩) GEOMAR Helmholtz Centre for Ocean Research Kiel(基尔海洋研究赫尔姆霍茨中心)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文分析事后概念瓶颈模型(post-hoc CBMs)中概念投影的失败案例,提出新指标解耦概念忠实性与预测准确性,揭示标准准确率评估无法检测的不忠实行为。

Comments Accepted at ECCV 2026, 41 pages, 13 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29888 2026-06-30 cs.LG cs.CV 57%

Same Concept, Different Directions: Cross-Modal Feature Heterogeneity in Sparse Autoencoders

同一概念,不同方向:稀疏自编码器中的跨模态特征异质性

Chungpa Lee, Jihoon Kwon, Kyle Min, Jy-yong Sohn

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 发现视觉-语言模型中同一概念在不同模态下的特征方向不一致(跨模态特征异质性),并提出训练模态特定稀疏自编码器后对齐对应特征的方法,提升重建保真度和跨模态检索与概念引导性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29112 2026-06-30 cs.LG 57%

A Novel Latent-Class Attack and its Detection by Class Subspace Orthogonalization

一种新型潜在类别攻击及其通过类别子空间正交化的检测方法

Guangmingmei Yang, David J. Miller, George Kesidis

专题命中 知识编辑与模型理解 :post-training(abstract);分类 cs.LG

AI总结 提出一种新型数据投毒攻击——潜在类别攻击,将未知类样本误标为已知类,使模型将未知类识别为已知类的子类;并基于类别子空间正交化(CSO)提出无需训练集的后训练检测方法,同时提供可视化解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28446 2026-06-30 astro-ph.IM astro-ph.SR cs.AI 57%

Domain-Informed Multi-View Self-Distillation for Astronomical Light-Curve Representation Learning with JEPA

领域信息引导的多视角自蒸馏用于基于JEPA的天文光变曲线表示学习

Yicheng Rui

机构 * Tsung-Dao Lee Institute, Shanghai Jiao Tong University, Shanghai 201210, China(李宗道研究所,上海交通大学,上海201210,中国)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 针对天文光变曲线不规则采样、复杂噪声和多物理时间尺度问题,提出结合语义保持视图、不确定性感知分词和多视角自蒸馏的JEPA框架,在StarEmbed分类基准上16个指标中15个超越手工特征,并在跨域适应中表现优异。

Comments 32 pages, 11 figures. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28401 2026-06-30 cs.CV cs.LG 57%

Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs

视觉驱动的偏好合成用于缓解VLM中的幻觉

Yunhun Nam, Jongheon Jeong

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 提出ViPSy框架,通过视觉线索构建策略对齐且视觉 grounded 的偏好数据,显著降低VLM幻觉率,在AMBER和Object HalBench上分别降低35.7%和24.5%,并提升通用视觉基准性能。

Comments 29 pages; Code is available at https://github.com/yunpal/ViPSy

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26343 2026-06-30 cs.LG 57%

MechRL: Reinforcement Learning Agents Perform Circuit Discovery for Mechanistic Interpretability

MechRL:强化学习智能体进行电路发现以实现机械可解释性

Barsat Khadka

机构 * The University of Southern Mississippi(美国密西西比州立大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 提出将电路发现转化为强化学习问题,使用PPO策略在GPT-2 small的144个注意力头上进行零消融和对比奖励,成功在训练任务和未见任务上恢复标准电路,验证了强化学习在机械可解释性中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02327 2026-06-30 cs.CV cs.AI 57%

Steerable Visual Representations

可操控的视觉表示

Jona Ruthardt, Manu Gaur, Deva Ramanan, Makarand Tapaswi, Yuki M. Asano

机构 * University of Technology Nuremberg(纽伦堡工业大学) Carnegie Mellon University(卡内基梅隆大学) International Institute of Information Technology, Hyderabad(海得拉巴国际信息技术学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文提出可操控的视觉表示,通过自然语言指导视觉特征,提升视觉任务的灵活性和泛化能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06972 2026-06-30 cs.CL 57%

Categorize Early, Integrate Late: Divergent Processing Strategies in Automatic Speech Recognition

早分类,晚整合:自动语音识别中的发散处理策略

Nathan Roll, Pranav Bhalerao, Martijn Bartelds, Arjun Pawar, Yuka Tatsumi, Tolulope Ogunremi, Chen Shani, Calbert Graham, Meghan Sumner, Dan Jurafsky

机构 * Stanford University(斯坦福大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 研究通过架构指纹法分析Transformer和Conformer在语音识别中的处理策略,发现Conformer早分类早判别,而Transformer晚整合,揭示了不同架构对表示学习的影响。

Comments 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏