arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8057 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8057 篇

2607.16652 2026-07-21 cs.CV cs.AI 新提交 57%

Position: Explanation Stability Is a Property of the Model Method Pair, Not the Model

立场:解释稳定性是模型与方法对的属性,而非模型本身的属性

Kabilan Elangovan, Daniel Ting

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 该论文指出关于解释稳定性的断言需经交叉方法验证,以胸部X光实验为例,不同模型在不同归因方法下稳定性排名反转,说明解释稳定性是模型与方法对的属性,基于解释的断言应多方法验证并明确归因算子。

Comments Accepted Position Paper at ICML 2026. https://openreview.net/forum?id=9r8sSaYhos

Journal ref Forty-third International Conference on Machine Learning Position Paper Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16355 2026-07-21 cs.CV cs.AI 新提交 57%

PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation

PhysAgent:用于物理上合理的视频生成的反射式智能体物理控制

Qirui Li, Jinkun Hao, Yibo Li, Ran Yi, Paul L. Rosin, Yu-Kun Lai

机构 * Shanghai Jiao Tong University(上海交通大学) Cardiff University(卡迪夫大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究物理上合理的视频生成问题,提出PhysAgent反射式智能体框架,通过闭环设计及物理控制API,改善参数控制,实现复杂轨迹等,实验证明其能生成更合理视频,有更好提示对齐及泛化效果。

Comments For project page, see https://iapple233.github.io/PhysAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16214 2026-07-21 cs.CV cs.AI 新提交 57%

What Makes Linguistic Representations Good Models of High-Level Visual Perception in the Human Brain?

是什么让语言表征成为人类大脑中高级视觉感知的良好模型?

Anna Bavaresco, Ina Klarić, Raquel Fernández, Marie-Francine Moens

机构 * European Commission, Joint Research Centre (JRC)(欧盟委员会,联合研究中心 (JRC))

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究语言模型图像描述对人类大脑高级视觉感知的预测性,考虑六种字幕类型和五种语言模型,发现机器生成字幕表现优,文本嵌入器优于自回归语言模型,大脑预测性和行为一致性在中间网络深度达峰值,确立字幕嵌入为研究工具。

Comments Supplementary Materials in the public GitHub repository referenced in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12071 2026-07-21 cs.CL 版本更新 57%

Beyond Parallel Tracking: Interactive Multi-Feature Fusion Drives Semantic Reconstruction from Non-invasive Brain Recordings

超越并行跟踪:交互式多特征融合驱动非侵入性脑记录的语义重建

Boda Xiao, Xiran Xu, Songyi Li, Yujie Yan, Xihong Wu, Heping Cheng, Jing Chen

机构 * Center for BioMed-X Research, Academy for Advanced Interdisciplinary Studies,Peking University(北京大学生物医学前沿创新中心、前沿交叉学科研究院) Speech and Hearing Research Center, School of Intelligence Science and Technology,Peking University(北京大学智能科学与技术学院言语听觉研究中心) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) National Biomedical Imaging Center, State Key Laboratory of Membrane Biology, Institute of Molecular Medicine, Peking-Tsinghua Center for Life Sciences, College of Future Technology, Peking University(国家生物医学成像中心、膜生物学国家重点实验室、分子医学研究所、北京大学生命科学联合中心、未来技术学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究针对非侵入性脑记录语义重建中表征不匹配问题,引入多特征融合框架,通过交互式门控机制结合静态与动态表征,经实验对比线性连接和非线性交叉注意力等方法,证明交叉注意力融合性能最佳,提供了新的脑到文本解码方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28021 2026-07-21 cs.LG 版本更新 57%

AOE: Exhaustive Out-of-Distribution Detection via Recalibrating Outlier Labels

AOE:通过重新校准异常标签实现穷尽式分布外检测

Fengqiang Wan, Qing-Yuan Jiang, Fu Shen, Yang Yang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Nanjing University of Science and Technology(南京理工大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 提出自适应置信度异常暴露(AOE)方法,通过温度缩放重新校准异常标签,利用自适应软目标保留分布外样本与分布内类别的语义关系,从而扩大分离边界并提升分布外检测性能。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-61080-0}

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15686 2026-07-20 cs.AI 新提交 57%

S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation

S1-Omni:用于科学理解、预测和生成的统一多模态推理模型

Jiahao Zhao, Junyi Liu, Lifeng Xu, Nan Xu, Qingli Wang, Qingxiao Li, Tianle Chen, Xiaoyu Wu, Yawen Zheng, Zikai Wang, Guanming Liu, Hequn Zhou, Jingyi Wang, Jingyuan Shu, Keqi Wang, Li He, Songyang Diao, Wenhui Xu, Xinyu Ren, Yaqin Fan, Yujin Zhou, Zhanao Yao

机构 * ScienceOne AI(科学一号人工智能) Wenge AI(文阁人工智能)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究针对科学人工智能模型能力分散问题,提出S1-Omni统一多模态推理模型,基于科学数据统一表示、知识对齐和解码三个核心组件,经训练和评估,在多基准测试中表现出色优于同类模型,为统一科学建模提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14228 2026-07-17 cs.CV cs.AI 新提交 57%

SeeSE3: Emergence of 3D Space in Vision Features

SeeSE3:视觉特征中3D空间的出现

Caroline Chen, Sayna Ebrahimi, Fedor Kitashov, Ming-Hsuan Yang, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

机构 * Google DeepMind(谷歌DeepMind)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究视觉基础模型构建的表征与3D欧几里得空间内在属性的关系,提出从拓扑和几何角度评估的探测器,发现自监督视觉模型有相关潜在子空间,并基于此提出“潜在空间导航”技术用于视觉里程计和定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14190 2026-07-17 cs.LG cs.IR stat.ML 新提交 57%

A Temporal Machine Learning-Based Time-to-Event Model for Predicting ALS Progression and Healthcare Utilization

基于时间序列机器学习的事件发生时间模型预测肌萎缩侧索硬化症进展及医疗保健利用情况

Zongliang Yue, Qi Li, Terry Heiman-Patterson, Frank Bearoff, Zhaohui Qin, Huanmei Wu

机构 * Harrison College of Pharmacy, Auburn University(奥本大学哈里森药学院) Fisk University(菲斯克大学) Lewis Katz School of Medicine, Temple University(天普大学刘易斯·卡茨医学院) Emory University(埃默里大学) Barnett College of Public Health, Temple University(天普大学巴尼特公共卫生学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究针对ALS预测临床有意义事件的挑战,开发受数字孪生启发的事件发生时间框架,整合多源数据,经聚类、建模等确定功能域及预测因素,构建TTE模型,能生成个性化生存曲线,为ALS相关决策支持提供可行方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14093 2026-07-17 cs.AI 新提交 57%

Intelligent Three Level Learning Architecture for Autonomous UAV Swarms in Search and Rescue

用于自主无人机群搜索和救援的智能三级学习架构

Oleksii Bychkov

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文针对无人机群搜索和救援提出智能三级学习架构,集成三种学习机制,通过架构契约形式化,引入群体元认知,有进展函数和主整合定理,解决了现有分层强化学习方法的五个基本限制。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23667 2026-07-17 cs.SD cs.AI eess.AS 版本更新 57%

Echoes: A semantically-aligned music deepfake detection dataset

回声:一种语义对齐的音乐深度伪造检测数据集

Octavian Pascu, Dan Oneata, Horia Cucu, Nicolas M. Muller

机构 * National University of Science and Technology POLITEHNICA Bucharest(波兰亚西夫技术大学布加勒斯特分校) Fraunhofer AISEC(弗劳恩霍夫信息安全研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 Echoes数据集通过语义对齐提升音乐深度伪造检测的鲁棒性,证明提供者多样性与语义对齐能提升检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13978 2026-07-16 cs.CV cs.AI 新提交 57%

Music-to-Dance Generation via Atomic Movements

通过原子运动生成音乐驱动的舞蹈

Xinhao Cai, Yixuan Sun, Minghang Zheng, Qingchao Chen, Xin Jin, Song-chun Zhu, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) National Institute of Health Data Science, Peking University(北京大学健康数据科学研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究音乐驱动的舞蹈生成问题,提出结构感知框架,将编排建模为原子运动序列,经数据分割、聚类及大语言模型处理得到原子运动注释,设计两阶段生成框架,提升舞蹈生成的结构连贯性、节奏对齐和自然度,增强可解释性与可控编辑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13239 2026-07-16 cs.AI 新提交 57%

Cost-Optimal Foundation Model Deployment Portfolio for Transportation Management

用于交通管理的成本最优基础模型部署组合

Xi Cheng, Ke Liu, Siyuan Feng, Jane Lin, H. Oliver Gao

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) The Hong Kong Polytechnic University(香港理工大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 研究交通管理中基础模型部署组合问题,提出FMDP混合整数规划,证明其NP难,给出多项式时间贪婪启发式算法,通过案例研究确定低成本组合,经盈亏平衡分析得出本地GPU投资合理的条件。

Comments Accepted at IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12924 2026-07-16 cs.AI 版本更新 57%

Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes

用于参数化动作马尔可夫决策过程的知识与梯度引导强化学习

Jonas Ehrhardt, René Heesch, Oliver Niggemann

机构 * HSU-AI Institute for Artificial Intelligence(HSU人工智能研究所)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 研究参数化动作马尔可夫决策过程中的强化学习,提出KGRL算法,利用领域知识修剪动作、约束参数空间,结合梯度细化参数,能提供局部解释并提高样本效率,优于现有强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05711 2026-07-16 cs.CL 版本更新 57%

Beyond tokens: a unified framework for latent communication in LLM-based multi-agent systems

超越Token:基于LLM的多智能体系统中潜在通信的统一框架

Yingzhuo Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出一个三维统一框架(通信内容、发送-接收对齐、信息融合方式),系统分类2024-2026年间18种潜在通信方法,识别五种设计模式并揭示开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24395 2026-07-16 cs.LG 版本更新 57%

AvAtar: Learning to Align via Active Optimal Transport

AvAtar: 通过主动最优输运学习对齐

Qi Yu, Ruizhong Qiu, Zhichen Zeng, My T. Thai, Huan Liu, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Florida(佛罗里达大学) Arizona State University(亚利桑那州立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出AvAtar框架,利用主动学习策略通过熵正则化最优输运的梯度影响量化候选点信息量,并采用伴随状态法高效求解,以提升对齐性能。

Comments Published as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12180 2026-07-15 cs.HC cs.AI 新提交 57%

TRAIL: A Platform for Configurable Human--AI Teaming Experiments

TRAIL:一个用于可配置人机协作实验的平台

Mohammad Amin Samadi, Pedro Martins De Bastos, Jaeyoon Choi, Spencer JaQuay, Seehee Park, Nia Nixon

机构 * School of Education, University of California, Irvine(加州大学伊文斯分校教育学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究人工智能队友设计属性对团队的影响,TRAIL平台将大五人格等与多种实验方法结合,在课堂部署中实现纵向链式实验、文本相似性分析等,发现不同人格代理对团队有不同影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11899 2026-07-15 physics.ao-ph cs.LG 新提交 57%

Predictive Modeling of High-Altitude Clear Air Turbulence in the United States: A Machine Learning Approach

美国高空晴空湍流的预测建模:一种机器学习方法

Kadir Gokdeniz, Irem Ulku

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 该研究利用机器学习模型,基于飞行员报告、ERA5再分析数据和飞机空气动力学参数,对美国200 - 350百帕压力水平下的高空晴空湍流进行预测建模,梯度提升算法表现最佳,强调了地理坐标等因素作用,凸显机器学习在CAT预测中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12682 2026-07-15 cs.LG 版本更新 57%

RAFP: Identifying LLM Lineages via Rare-Region Fingerprints

RAFP:通过稀有区域指纹识别大语言模型谱系

Yun-Yun Tsai, Jia Hao Liang, Chuan Guo, Junfeng Yang, Laurens van der Maaten

机构 * Department of Computer Science, Columbia University, USA(哥伦比亚大学计算机科学系) Meta, USA(Meta公司)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 针对大语言模型所有权验证需求,提出RAFP框架,利用稀有区域指纹识别模型谱系。该方法非侵入性,通过离散梯度优化构建指纹,理论分析表明其在微调下似然变化有界,实验显示在黑盒设置中性能优于基线。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11257 2026-07-14 cs.CV cs.LG 新提交 57%

LaGuadia: Language-Guided Adaptive Distillation from Pathology Foundation Models

拉瓜迪亚:基于病理学基础模型的语言引导自适应蒸馏

Gangsu Kim, Won-Ki Jeong

机构 * College of Informatics, Korea University(韩国大学信息学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究针对病理学基础模型计算成本高问题,提出拉瓜迪亚框架,通过多阶段流程,在临床语言指导下整合多模型知识,进行自适应蒸馏。实验表明其87M参数学生模型性能出色,凸显临床语言对构建高效可靠数字病理系统的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11026 2026-07-14 cs.CL 新提交 57%

Dimensionality in Satisfaction Ratings

满意度评级中的维度

Andrew Hong, Jason Potteiger

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 该研究用大语言模型注释消费品公司对话文本,分解客户服务满意度为多轴,验证注释与客户自评的关系,发现轴间相关性及共线性,指出分解价值在于归因和覆盖,能识别对话数据中细微的客户体验驱动因素。

Comments 25 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10590 2026-07-14 cs.CL 新提交 57%

Demographic Prompting at Scale: When More Attributes Hurt LLM--Human Agreement

大规模人口统计学提示:当更多属性损害大语言模型与人类的一致性时

Mahammed Kamruzzaman, Shrabon Kumar Das, Gene Louis Kim

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究人口统计学属性作提示线索对LLM预测与人类注释一致性的影响,通过五个开源LLM在五个任务中实验,发现一致性与属性数量有关,受属性可学习性等因素影响,表明人口统计学提示效用依赖上下文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10291 2026-07-14 cs.SE cs.AI 新提交 57%

Partial Contracts Suffice: Sound, LLM-Inferred Regression Verification

部分契约就足够了:可靠的、由大语言模型推断的回归验证

Yiannis Charalambous, Rafael Menezes, Youcheng Sun, Lucas C. Cordeiro

机构 * The University of Manchester(曼彻斯特大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 研究软件回归验证难题,提出基于契约的工具,探讨部分契约的充分性,通过强化契约、自动推断等方法,实现可靠验证,在多方面取得良好效果,证明安全保留条件等价性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10165 2026-07-14 cs.CV cs.AI 新提交 57%

EmoStyle: Affective Conditioning of Style-Specialist Experts for Emotional Image Generation

EmoStyle:用于情感图像生成的风格专家情感调节

Dexiang Hong, Yijie Guo, Weidong Chen, Xinyan Liu, Zixuan Zou, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 针对情感感知艺术图像生成中训练与测试时属性不一致造成的控制差距问题,提出EmoStyle框架,利用语言模型推理器预测情感线索,编码情感字段指导生成,训练专用LoRA适配器结合风格表达情感,经视觉语言模型引导排序,在挑战赛中获佳绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10074 2026-07-14 cs.LG 新提交 57%

Distance-Preserving Embeddings in Inhomogeneous Random Graphs

非均匀随机图中的距离保持嵌入

My Le, Luana Ruiz, Souvik Dhara

机构 * Johns Hopkins University(约翰斯·霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究非均匀随机图中距离保持嵌入,基于地标嵌入分析最短路径近似,扩展失真保证到全局平均并统一分析,引入GNN增强变体,使模型能从小图学习并推广到大型真实网络,保持或超越经典嵌入保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09674 2026-07-14 cs.CY 新提交 57%

From Tools to Teacher-Built Teammates: No-Code Pedagogical Plugin Authoring with LearnAdapt Agentic Studio and PedOS 1.1 Lumina

从工具到教师构建的队友:使用LearnAdapt智能工作室和PedOS 1.1 Lumina进行无代码教学插件创作

Nizam Kadir

专题命中 其他安全 :safety(abstract);分类 cs.CY

AI总结 该研究针对教师和研究人员难以定制教育AI的问题,介绍了基于PedOS 1.1 Lumina的LearnAdapt智能工作室,它能让非编码人员用英语描述学习交互,完成插件创作、安全检查等,展示了从提示到证据捕获的完整生命周期,实现从固定工具到教师构建队友的转变。

Comments 3 pages, 1 figure, Accepted into the 27th International Conference on Artificial Intelligence in Education Interactive Events Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00756 2026-07-14 cond-mat.mtrl-sci cs.LG 57%

A New Workflow for Materials Discovery Bridging the Gap Between Experimental Databases and Graph Neural Networks

一种新的工作流程用于材料发现,弥合实验数据库与图神经网络之间的差距

Brandon Schoener, Yuting Hu, Pasit Wanlapha, Akshay Rengarajan, Ian Moog, Michael Wang, Peihong Zhang, Jinjun Xiong, Hao Zeng

机构 * Department of Physics, University at Buffalo, State University of New York, Buffalo, NY Department of Computer Science \& Engineering, University at Buffalo, State University of New York, Buffalo, NY Institute for Artificial Intelligence Data Science, University at Buffalo, State University of New York, Buffalo, NY

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种新的工作流程,通过将实验数据库与晶体学信息文件对齐,弥补了实验数据与图神经网络之间的差距,提升了材料属性预测的准确性和效率。

Comments 8 pages, 3 figures, 1 table, submitted to Journal of Magnetism and Magnetic Materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06896 2026-07-14 eess.AS cs.CL 版本更新 57%

TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding

TagSpeech:基于细粒度时间定位的端到端多说话人自动语音识别与说话人分离

Mingyue Huo, Yiwen Shao, Yuheng Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究提出TagSpeech框架,利用时间锚点定位技术联合多说话人ASR与说话人分离。通过关键设计解决细粒度对齐挑战,端到端建模“谁在何时说了什么”。实验显示其在DER上优于基线,采用参数高效训练范式,低计算成本获强性能。

Comments Accepted to ACL2026 Main Oral; v2: added overlap analysis in Section 5.2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09024 2026-07-13 cs.CV cs.AI 新提交 57%

Video Generation Models are General-Purpose Vision Learners

视频生成模型是通用视觉学习者

Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

机构 * Google DeepMind(谷歌DeepMind)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23964 2026-07-13 cs.LG cs.CV q-bio.QM 新提交 57%

3D Masked Autoencoders are Robust Learners of Volumetric and Multimodal Cellular Representations for Microscopy

3D掩码自编码器是显微镜体积和多模态细胞表示的鲁棒学习器

Amirhossein Kardoost, Lion Gleiter, Tingying Peng, Carsten Marr

机构 * Institute of AI for Health & Helmholtz AI, Computational Health Center, Helmholtz Munich – German Research Center for Environmental Health(亥姆霍兹慕尼黑中心 - 德国环境健康研究中心,计算健康中心,健康人工智能研究所与亥姆霍兹人工智能) Department of Medicine III, Ludwig-Maximilian-University Hospital(路德维希-马克西米利安大学医院第三内科) Department of Physics, Ludwig-Maximilian-University(路德维希-马克西米利安大学物理系) German Cancer Consortium (DKTK), partner site Munich(德国癌症联盟(DKTK)慕尼黑合作站点) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 系统比较2D和3D掩码自编码器在体积显微镜数据上的表现,发现3D模型在下游任务中更优,并通过跨模态对齐和频域正则化进一步提升性能,在蛋白质相互作用和定位任务上达到最先进水平。

Comments Code is available at: https://github.com/marrlab/mae3d-opencell

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10229 2026-07-13 cs.CL 版本更新 57%

Latent Thoughts Tuning: Bridging Context and Reasoning with Fused Information in Latent Tokens

潜在思维调整:通过潜在令牌中的融合信息连接上下文与推理

Weihao Liu, Dehai Min, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究提出潜在思维调整(LT-Tuning)框架,通过重新定义潜在思维构建与部署方式,引入上下文预测融合机制,结合三阶段课程学习,实现潜在与显式思维模式动态切换,优于现有潜在推理基线,有效缓解特征崩溃并提升推理精度。

Comments In Proceedings of the Forty-third International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏