arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9419 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9419 篇

2604.13891 2026-04-16 cs.RO cs.AI cs.SY eess.SY 57%

Beyond Conservative Automated Driving in Multi-Agent Scenarios via Coupled Model Predictive Control and Deep Reinforcement Learning

通过耦合模型预测控制和深度强化学习实现多智能体场景下的非保守自动驾驶

Saeed Rahmani, Gözde Körpe, Zhenlin, Xu, Bruno Brito, Simeon Craig Calvert, Bart van Arem

机构 * TU Delft, Faculty of Civil Engineering and Geosciences, Department of Transport and Planning(代尔夫特理工大学,土木工程与地质科学学院,交通与规划系) NVIDIA

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出结合MPC与RL的框架,提升多智能体场景下的导航性能,实验表明MPC-RL在碰撞率和成功率上优于传统方法,且在零样本迁移中表现更优,展示了MPC对跨场景鲁棒性的贡献。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13824 2026-04-16 cs.LG 57%

Beyond State Consistency: Behavior Consistency in Text-Based World Models

超越状态一致性:文本基础世界模型中的行为一致性

Youling Huang, Guanqiao Chen, Junchi Yao, Lu Wang, Fangkai Yang, Chao Du, ChenZhuo Zhao, Pu Zhao, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * Dalian University of Technology(大连理工大学) MBZUAI Peking University(北京大学) Microsoft(微软)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出行为一致性训练方法,通过改进世界模型与真实环境的功能一致性,提升长期对齐效果,实验显示在WebShop和TextWorld中表现优异,同时保持单步预测质量。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13804 2026-04-16 cs.LG 57%

Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning

角色超越言语:通过强化学习利用角色扮演评估音频大语言模型

Dongjie Fu, Fangming Feng, Xize Cheng, Linjun Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出RoleJudge框架,通过多模态评估系统评估语音与角色的一致性,引入RoleChat数据集并采用多阶段训练和标准对齐强化学习,验证了多维评估框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05452 2026-04-16 cs.CL 57%

LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models

LLMEval-Fair: 一个大规模纵向研究,探讨大型语言模型的稳健与公平评估

Ming Zhang, Yujiong Shen, Jingyi Deng, Yuhui Wang, Huayu Sha, Kexin Tan, Qiyuan Peng, Yue Zhang, Junzhe Wang, Shichun Liu, Yueyuan Huang, Jingqi Tong, Changhao Jiang, Yilong Wu, Zhihao Zhang, Mingqi Wu, Mingxu Chai, Zhiheng Xi, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan NLP Group(复旦大学自然语言处理组)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 LLMEval-Fair通过动态评估框架和抗污染数据整理,揭示了静态基准无法检测的模型性能上限和数据污染问题,提供了更可靠的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13756 2026-04-16 cs.CL cs.CV 57%

MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging

MedRCube:面向医学影像中多模态大语言模型细粒度与深入评估的多维框架

Zhijie Bao, Fangke Chen, Licheng Bao, Chenhui Zhang, Wei Chen, Jiajie Peng, Zhongyu Wei

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) School of Integrated Circuits, Zhejiang University(浙江大学集成电路学院) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出MedRCube框架,通过两阶段构建流程对33个MLLM进行细粒度评估,揭示先前方法无法获取的洞察,并引入可信度评估子集,发现快捷行为与诊断性能的显著正相关,引发临床部署的担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13271 2026-04-16 cs.LG 57%

Enhancing Confidence Estimation in Telco LLMs via Twin-Pass CoT-Ensembling

通过双通道CoT-集成增强电信领域LLM的置信度估计

Anton Saenko, Pranshav Gajjar, Abiodun Ganiyu, Vijay K. Shah

机构 * NextG Wireless Lab(NextG无线实验室) North Carolina State University(北卡罗来纳州立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出双通道CoT-集成方法,通过多独立推理评估提升电信领域LLM的置信度估计,降低ECE误差达88%,提高模型自我评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13067 2026-04-16 cs.HC cs.CL 57%

From Seeing it to Experiencing it: Interactive Evaluation of Intersectional Voice Bias in Human-AI Speech Interaction

从看见它到体验它:交互式评估人类-人工智能语音交互中的交叉性声音偏见

Shree Harsha Bokkahalli Satish, Maria Teleki, Christoph Minixhofer, Ondrej Klejch, Peter Bell, Éva Székely

机构 * KTH Royal Institute of Technology(皇家理工学院) University of Edinburgh(爱丁堡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文通过控制测试队列和交互研究设计,探讨了声音转换对信任和接受度的影响,揭示了不同口音和性别在语音处理中的交叉性偏见。

Comments 6 pages, 3 figures, 1 table, Accepted to CHI Extended Abstracts Poster session 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09687 2026-04-16 cs.CV cs.AI 57%

Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models

Grid2Matrix: 揭示视觉语言模型中的数字失读

Yunkai Zhang, Linda Li, Yingxin Cui, Xiyuan Ruan, Zeyu Zheng, Kezhen Chen, Yi Zhang, Diji Yang

机构 * BAIR, UC Berkeley(伯克利大学BAIR实验室) UC Santa Cruz(圣克拉拉大学) Analogy AI

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Grid2Matrix通过控制视觉复杂度测试视觉语言模型在捕捉细节方面的不足,发现模型在小网格上表现不佳,揭示了视觉编码与语言表达间的差距,即'数字失读'。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08639 2026-04-16 cs.CV cs.AI 57%

UNBOX: Unveiling Black-box visual models with Natural-language

UNBOX:通过自然语言揭示黑盒视觉模型

Simone Carnemolla, Chiara Russo, Simone Palazzo, Quentin Bouniot, Daniela Giordano, Zeynep Akata, Matteo Pennisi, Concetto Spampinato

机构 * University of Catania(卡塔尼亚大学) Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(海德堡-慕尼黑马克斯·普朗克研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 UNBOX在无数据、无梯度、无反向传播约束下,利用大语言模型和扩散模型生成可解释文本描述,揭示模型隐含概念与潜在偏见,通过实验验证其在ImageNet-1K等数据集上的有效性。

Comments Under review at IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05795 2026-04-15 cs.CL 57%

Measuring What Matters!! Assessing Therapeutic Principles in Mental-Health Conversation

衡量重要性!!评估心理健康对话中的治疗原则

Abdullah Mazhar, Het Riteshkumar Shah, Aseem Srivastava, Smriti Joshi, Md Shad Akhtar

机构 * IIIT Delhi(印度德里理工学院) MBZUAI(马尔科姆·比尔人工智能研究所) Wysa

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出CARE框架,通过多阶段方法评估AI生成的治疗回应是否符合临床标准,实验显示其在F-1分数上优于基线模型,展示了结构化推理和上下文建模的重要性。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12282 2026-04-15 cs.CL 57%

Towards Robust Real-World Spreadsheet Understanding with Multi-Agent Multi-Format Reasoning

面向多代理多格式推理的鲁棒现实世界电子表格理解

Houxing Ren, Mingjie Zhan, Zimu Lu, Ke Wang, Yunqiao Yang, Haotian Hou, Hongsheng Li

机构 * CUHK MMLab(CUHK多模态实验室) SenseTime Research(商汤科技研究院) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(创新香港下的CPII)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出SpreadsheetAgent框架,通过多模态逐步阅读推理解决大规模电子表格处理问题,通过结构草图和行列摘要提升推理可靠性,实验表明其在Spreadsheet Bench上表现优异。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12034 2026-04-15 cs.AI 57%

Memory as Metabolism: A Design for Companion Knowledge Systems

记忆作为代谢:一种陪伴知识系统的 设计

Stefan Miteski

机构 * CODE University Berlin(CODE大学柏林)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种针对单用户知识维基的治理框架,通过五项操作处理记忆中的矛盾证据,以避免固化问题。

Comments 41 pages, 1 table. Preprint v3.642. Concept DOI: 10.5281/zenodo.19501651

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06390 2026-04-15 cs.CV cs.AI 57%

MorphDistill: Distilling Unified Morphological Knowledge from Pathology Foundation Models for Colorectal Cancer Survival Prediction

MorphDistill: 从病理基础模型中提取统一形态学知识以预测结直肠癌生存率

Hikmat Khan, Usama Sajjad, Metin N. Gurcan, Anil Parwani, Wendy L. Frankel, Wei Chen, Muhammad Khalid Khan Niazi

机构 * Department of Pathology, College of Medicine, The Ohio State University Wexner Medical Center(俄亥俄州立大学医学学院病理学系,韦克斯纳医学中心) Center for Artificial Intelligence Research, Wake Forest University School of Medicine(威克森林大学医学院人工智能研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出MorphDistill框架,通过多病理基础模型提取互补知识,构建紧凑的结直肠癌特异性编码器,提升生存预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11801 2026-04-14 cs.CL 57%

CLSGen: A Dual-Head Fine-Tuning Framework for Joint Probabilistic Classification and Verbalized Explanation

CLSGen:一种用于联合概率分类和 verbalized 解释的双头微调框架

WonJin Yoon, Kangyu Zhu, Ian Bulovic, Autumn Sehy, Yanjun Gao, Dmitriy Dligach, Majid Afshar, Timothy A. Miller

机构 * Boston Children’s Hospital(波士顿儿童医院) Harvard Medical School(哈佛医学院) University of Colorado Anschutz Medical Campus(科罗拉多大学安施图茨医学院) Loyola University Chicago(芝加哥洛约拉大学) University of Wisconsin Madison(威斯康星大学麦迪逊分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 CLSGen 提出了一种双头微调框架,通过新的架构和方法实现概率估计与解释生成的平衡,实验表明其在分类和解释质量上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11609 2026-04-14 cs.AI cs.HC 57%

Intersectional Sycophancy: How Perceived User Demographics Shape False Validation in Large Language Models

交叉性趋炎附势:感知的用户人口统计如何影响大语言模型中的虚假验证

Benjamin Maltbie, Shivam Raval

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究探讨用户人口统计如何影响大语言模型的虚假验证行为,发现GPT-5-nano在哲学领域比数学领域更趋炎附势,而拉丁裔人群接受度最高,而自信的拉丁裔女性得分最低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11518 2026-04-14 cs.SE cs.AI 57%

From Translation to Superset: Benchmark-Driven Evolution of a Production AI Agent from Rust to Python

从翻译到超集:面向生产AI代理的基准驱动演进:从Rust到Python

Jinhua Wang, Biswa Sengupta

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的持续代码翻译方法,将Rust生产代码库迁移至Python,通过基准驱动迭代优化,实现功能扩展与性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09430 2026-04-14 cs.IR cs.AI quant-ph 57%

On the Representational Limits of Quantum-Inspired 1024-D Document Embeddings: An Experimental Evaluation Framework

关于量子启发式1024维文档嵌入表示的限制:一个实验评估框架

Dario Maio

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一个实验框架,用于构建基于重叠窗口和多尺度聚合的量子启发式1024维文档嵌入,通过诊断工具评估混合检索性能,发现BM25仍为强基线,而量子启发式嵌入在排名信号上表现不稳定。

Comments 44 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03926 2026-04-14 cs.CL 57%

Doc-PP: Document Policy Preservation Benchmark for Large Vision-Language Models

Doc-PP:大型视觉-语言模型文档政策保护基准

Haeun Jang, Hwan Chang, Hwanhee Lee

机构 * Chung-Ang University(中央大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出Doc-PP基准,用于评估大型视觉-语言模型在严格非披露政策下对文档的理解能力,揭示了推理诱导的安全差距,并提出DVA框架提升政策合规性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17574 2026-04-14 cs.CV cs.AI 57%

HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks

HumanVBench: 通过自动合成基准测试探测多模态大语言模型中的以人为本的视频理解

Ting Zhou, Daoyuan Chen, Qirui Jiao, Bolin Ding, Yaliang Li, Ying Shen

机构 * Sun Yat-Sen University(中山大学) Alibaba Group(阿里巴巴集团) Peng Cheng Laboratory(鹏城实验室) Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(广东省消防科学与智能应急技术重点实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出HumanVBench,一个针对多模态大语言模型(MLLMs)中以人为本的视频理解能力的综合基准测试,通过自动化流程生成高质量视频注释和挑战性问题,揭示30个领先MLLMs在感知细微情绪和对齐语音与视觉线索方面的不足。

Comments Accepted as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10978 2026-04-14 cs.HC cs.AI 57%

Enabling and Inhibitory Pathways of Students' AI Use Concealment Intention in Higher Education: Evidence from SEM and fsQCA

高等教育学生AI使用隐瞒意图的促进与抑制路径:基于SEM和fsQCA的实证研究

Yiran Du, Huimin He

机构 * University of Cambridge(剑桥大学) Xi'an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文通过SEM和fsQCA方法探讨高等教育学生AI使用隐瞒意图的促进与抑制路径,揭示感知污名、风险和政策不确定性通过增强负面评价恐惧促进隐瞒,而AI自我效能、公平感知和社会支持通过提升心理安全减少隐瞒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10968 2026-04-14 cs.CL 57%

YIELD: A Large-Scale Dataset and Evaluation Framework for Information Elicitation Agents

YIELD:信息提取代理的大规模数据集和评估框架

Victor De Lima, Grace Hui Yang

机构 * InfoSense Lab, Georgetown University(乔治城大学信息感知实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出YIELD数据集和评估框架,用于研究信息提取代理,通过2600万token的对话数据提升模型对真实信息提取行为的对齐能力。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10740 2026-04-14 cs.CL 57%

RCBSF: A Multi-Agent Framework for Automated Contract Revision via Stackelberg Game

RCBSF: 一种基于Stackelberg游戏的多智能体框架用于通过Stackelberg游戏实现自动合同修订

Shijia Xu, Yu Wang, Xiaolong Jia, Zhou Wu, Kai Liu, April Xiaowen Dong

机构 * Chongqing University(重庆大学) Queen Mary University of London(伦敦玛丽女王大学) Chongqing Key Laboratory of Big Data Intelligence and Privacy Computing(重庆市大数据智能与隐私计算重点实验室) Fangda Partners(方达律师事务所)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出RCBSF框架,通过Stackelberg游戏解决大语言模型在法律AI中合同修订的可靠性问题,通过风险约束双层结构提升输出效用,实验证明其在风险解决率和token效率方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10687 2026-04-14 cs.CL 57%

QFS-Composer: Query-focused summarization pipeline for less resourced languages

QFS-Composer:面向资源匮乏语言的查询聚焦摘要流程

Vuk Đuranović, Marko Robnik Šikonja

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出QFS-Composer框架,通过查询分解、问题生成、问题回答和抽象摘要提升摘要与用户意图的一致性,针对资源匮乏语言进行查询聚焦摘要研究。

Comments 12 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10632 2026-04-14 cs.SD cs.LG cs.MM eess.AS 57%

Multimodal Dataset Normalization and Perceptual Validation for Music-Taste Correspondences

多模态数据集规范化与感知验证:音乐-味觉对应关系

Matteo Spanio, Valentina Frezzato, Antonio Rodà

机构 * University of Padova(帕多瓦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文通过两项实验验证了合成FMA标注中存在听觉调味效果,展示了跨模态结构在不同监督下的保持以及计算目标与人类感知的显著一致性。

Comments Submitted to SMC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10591 2026-04-14 cs.CV cs.AI 57%

GeoMeld: Toward Semantically Grounded Foundation Models for Remote Sensing

GeoMeld:迈向遥感领域语义引导的基模模型

Maram Hasan, Md Aminur Hossain, Savitra Roy, Souparna Bhowmik, Ayush V. Patel, Mainak Singha, Subhasis Chaudhuri, Muhammad Haris Khan, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Space Applications Centre, ISRO(印度空间研究组织空间应用中心) University of Trento(特伦托大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出GeoMeld数据集,通过语义引导的监督方法,结合多模态对齐,提升遥感领域基模模型的性能和鲁棒性。

Comments Accepted at CVPR Workshop 2026; 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05767 2026-04-14 cs.CV cs.CL 57%

Beyond the Beep: Scalable Collision Anticipation and Real-Time Explainability with BADAS-2.0

超越蜂鸣声:通过BADAS-2.0实现可扩展的碰撞预测与实时可解释性

Roni Goldshmidt, Hamish Scott, Lorenzo Niccolini, Hernan Matzner

机构 * Nexar AI

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 BADAS-2.0在长尾基准、知识蒸馏和可解释性三方面提升,通过大规模数据集扩展和轻量模型部署实现实时碰撞预测与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21428 2026-04-14 cs.CV cs.LG 57%

PSF-Med: Measuring and Explaining Paraphrase Sensitivity in Medical Vision Language Models

PSF-Med: 医学视觉语言模型中反语敏感性的测量与解释

Binesh Sadanandan, Vahid Behzadan

机构 * SAIL Lab, University of New Haven(纽黑文大学SAIL实验室)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出PSF-Med基准,通过26850个胸部X光问题及92856个意义保持的改写句,评估九种VLMs在临床问题改写下的稳定性与视觉依赖性,发现模型在反语下的翻转率差异显著,且通过特征分析揭示了模型决策机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22142 2026-04-14 cs.DC cs.LG 57%

On Harnessing Idle Compute at the Edge for Foundation Model Training

在边缘计算中利用空闲计算资源进行基础模型训练

Leyang Xue, Meghana Madhyastha, Myungjin Lee, Amos Storkey, Randal Burns, Mahesh K. Marina

机构 * The University of Edinburgh(爱丁堡大学) Johns Hopkins University(约翰霍普金斯大学) Cisco Research(思科研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出Cleave框架,通过利用边缘设备的异构计算资源,实现与云训练相媲美的性能,并在设备异构性和故障恢复方面取得显著优势。

Comments Extended abstract version of this paper appeared in ACM MobiCom 2025. Workshop version of this paper appeared in EuroMLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05342 2026-04-14 cs.CV cs.LG 57%

Delta Rectified Flow Sampling for Text-to-Image Editing

Delta Rectified Flow Sampling 用于文本到图像编辑

Gaspard Beaudouin, Minghan Li, Jaeyeon Kim, Sung-Hoon Yoon, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard University(哈佛大学人工智能与机器人实验室) Computer Science Department, Harvard University(哈佛大学计算机科学系) Multimodal Intelligence and Perception Lab, DGIST(大邱庆北科学技术院多模态智能与感知实验室) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学肯普纳自然与人工智能研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出Delta Rectified Flow Sampling (DRFS),一种无需反向传播的路径感知编辑框架,通过建模源与目标速度场的差异以减少过平滑伪影,并引入时间依赖的位移项提升目标分布对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04038 2026-04-14 cs.CL cs.CV 57%

ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents

ZARA:通过证据驱动的LLM代理实现无训练的运动时间序列推理

Zechen Li, Baiyu Chen, Hao Xue, Flora D. Salim

机构 * University of New South Wales, Sydney(新南威尔士大学悉尼校区) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 ZARA通过证据驱动的LLM代理实现无训练的运动时间序列推理,利用参考数据构建统计学基础的知识库,提升活动识别的泛化能力和跨领域适应性。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏