arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8034 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8034 篇

2505.13820 2026-05-28 cs.LG cs.AI cs.CL 67%

Structured Agent Distillation for Large Language Model

大型语言模型的结构化智能体蒸馏

Jun Liu, Zhenglun Kong, Peiyan Dong, Changdi Yang, Tianqi Li, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Pu Zhao, Xue Lin, Dong Huang, Yanzhi Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) MIT(麻省理工学院) Northeastern University(东北大学) Adobe Research(Adobe研究) National University of Singapore(新加坡国立大学) University of Georgia(佐治亚大学) Florida International University(佛罗里达国际大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出结构化智能体蒸馏框架,通过分段对齐推理和动作跨度,将大型语言模型智能体压缩为小型学生模型,在保持决策性能的同时降低推理成本。

Journal ref The 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07632 2026-05-27 cs.CL cs.AI cs.LG 67%

Post-training makes large language models less human-like

后训练使大型语言模型更不像人类

Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Brändle, David Broska, Jason W. Burton, Nuno Busch, Frederick Callaway, Vanessa Cheung, Brian Christian, Julian Coda-Forno, Can Demircan, Vittoria Dentella, Maria K. Eckstein, Noémi Éltető, Michael Franke, Thomas L. Griffiths, Fritz Günther, Susanne Haridi, Sebastian Hellmann, Stefan Herytash, Linus Hof, Eleanor Holton, Isabelle Hoxha, Zak Hussain, Akshay Jagadish, Elif Kara, Valentin Kriegmair, Evelina Leivada, Li Ji-An, Tobias Ludwig, Maximilian Maier, Marcelo G. Mattar, Marvin Mathony, Alireza Modirshanechi, Robin Na, Mariia Nadverniuk, Antonios Nasioulas, Surabhi S. Nath, Helen Niemeyer, Kate Nussenbaum, Sebastian Olschewski, Thorsten Pachur, Stefano Palminteri, Aliona Petrenco, Camille V. Phaneuf-Hadd, Angelo Pirrone, Manuel Rausch, Laura Raveling, Shashank Reddy, Milena Rmus, Evan M. Russek, Tankred Saanum, Kai Sandbrink, Louis Schiekiera, Johannes A. Schubert, Luca M. Schulze Buschoff, Nishad Singhi, Leah H. Somerville, Mikhail S. Spektor, Xin Sui, Christopher Summerfield, Mirko Thalmann, Anna I. Thoma, Taisiia Tikhomirova, Vuong Truong, Polina Tsvilodub, Konstantinos Voudouris, Kristin Witte, Shuchen Wu, Dirk U. Wulff, Hua-Dong Xiong, Songlin Xu, Lance Ying, Xinyu Zhang, Jian-Qiao Zhu, Eric Schulz

机构 * Helmholtz Munich(海德堡-慕尼黑亥姆霍兹中心) Massachusetts Institute of Technology(麻省理工学院) University of Tübingen(图宾根大学) University of Oxford(牛津大学) Stanford(斯坦福大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过引入Psych-201数据集,发现后训练(将基础模型转化为有用助手的过程)一致地降低了模型与人类行为的对齐度,且这种错位在新模型世代中加剧,而人物诱导技术无法改善个体层面的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08999 2026-05-27 cs.CL cs.AI cs.LG 67%

ASTRA: Adaptive Semantic Tree Reasoning Architecture for Complex Table Question Answering

ASTRA: 面向复杂表格问答的自适应语义树推理架构

Xiaoke Guo, Songze Li, Zhiqiang Liu, Zhaoyan Gong, Yuanxiang Liu, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ASTRA架构,通过AdaSTR将表格重构为逻辑语义树,并利用DuTR双模式推理框架结合树搜索文本导航与符号代码执行,在复杂表格问答中达到最优性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11394 2026-05-27 cs.CL cs.AI cs.LG 67%

Stop Listening to Me! How Multi-turn Conversations Can Degrade LLM Reliability

别听我的!多轮对话如何降低LLM的可靠性

Kevin H. Guo, Chao Yan, Avinash Baidya, Katherine Brown, Xiang Gao, Juming Xiong, Zhijun Yin, Bradley A. Malin

机构 * Vanderbilt University(范德比尔大学) Vanderbilt University Medical Center(范德比尔大学医学中心) Intuit AI Research(Intuit人工智能研究)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出“坚持或切换”(SoS)框架,通过将问答空间分割为多个顺序呈现来评估LLM在多轮对话中的可靠性,发现对话税导致准确性和拒绝错误建议的能力平均下降30%,并观察到盲目切换现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19500 2026-05-22 cs.AI cs.CL cs.LG 67%

NaviAgent: Graph-Driven Bilevel Planning for Scalable Tool Orchestration

NaviAgent: 一种基于图的双层规划用于可扩展的工具编排

Yan Jiang, Hao Zhou, Lizhong GU, Tianlong Li, Ruinan Jin, Wanqi Zhou, Ai Han

机构 * Department of Electrical and Computer Engineering, The Ohio State University, USA(电气与计算机工程系,俄亥俄州立大学,美国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出NaviAgent,一种基于图的双层规划框架,通过解耦任务规划与工具执行,提升大规模工具编排的可扩展性和鲁棒性,实验表明其在任务成功率和实际应用中表现优异。

Comments Accepted to ICML 2026

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20668 2026-05-21 cs.CL cs.AI cs.LG 67%

On the limits and opportunities of AI reviewers: Reviewing the reviews of Nature-family papers with 45 expert scientists

人工智能审稿人的局限与机遇:对Nature系列论文审稿的45位专家科学家的审查

Seungone Kim, Dongkeun Yoon, Kiril Gashteovski, Juyoung Suk, Jinheon Baek, Pranjal Aggarwal, Ian Wu, Viktor Zaverkin, Spase Petkoski, Daniel R. Schrider, Ilija Dukovski, Francesco Santini, Biljana Mitreska, Yong Jeong, Kyeongha Kwon, Young Min Sim, Dragana Manasova, Arthur Porto, Biljana Mojsoska, Makoto Takamoto, Marko Shuntov, Ruoqi Liu, Hyunjoo Jenny Lee, Niyazi Ulas Dinç, Yehhyun Jo, Sunkyu Han, Chungwoo Lee, Huishan Li, Esther H. R. Tsai, Ergun Simsek, Khushboo Shafi, Yeonseung Chung, Jihye Park, Aleksandar Shulevski, Henrik Christiansen, Yoosang Son, Elly Knight, Amanda Montoya, Jeongyoun Ahn, Christian Langkammer, Heera Moon, Changwon Yoon, Nikola Stikov, Mooseok Jang, Edward Choi, Junhan Kim, Yeon Sik Jung, Woo Youn Kim, Jae Kyoung Kim, Ishraq Md Anjum, Hyun Uk Kim, Drew Bridges, Carolin Lawrence, Xiang Yue, Alice Oh, Akari Asai, Sean Welleck, Graham Neubig

机构 * Nature(自然)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过大规模专家标注研究,探讨了AI审稿人在科学同行评审中的能力与局限,发现AI审稿在准确性、显著性和证据充分性方面表现优异,但存在领域知识有限、上下文管理不足等弱点,表明AI审稿是人类审稿的补充而非替代。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20268 2026-05-21 cs.LG cs.AI cs.CL 67%

Chronicle: A Multimodal Foundation Model for Joint Language and Time Series Understanding

Chronicle:一种用于联合语言和时间序列理解的多模态基础模型

Paul Quinlan, Jeremy Levasseur, Qingguo Li, Xiaodan Zhu

机构 * InertialAI Department of Electrical and Computer Engineering, Queen’s University(皇后大学电气与计算机工程系) Department of Mechanical and Materials Engineering, Queen’s University(皇后大学机械与材料工程系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Chronicle,一种联合训练语言和时间序列的多模态基础模型,通过统一架构实现两者共享参数,从而在多个任务上取得了优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18233 2026-05-19 cs.CV 67%

Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos

增强无列车无限帧生成以实现一致的长视频

X. Feng, J. Zhu, M. Wu, C. Chen, F. Mao, H. Guo, J. Wu, X. Chu, K. Huang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(复杂系统认知与决策智能重点实验室,中国科学院自动化研究所,北京,中国) AMAP, Alibaba Group, Beijing, China(AMAP,阿里巴巴集团,北京,中国)

专题命中 其他安全 :alignment(abstract,abstract_cn)

AI总结 本文提出MIGA方法,通过两阶段对齐机制和双一致性增强机制,解决训练与推理不匹配和长时一致性维持的问题,从而提升长视频生成效果。

Comments Accepted by ICML 2026~

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12539 2026-05-19 cs.LO 67%

ocLTL: LTL Realizability and Synthesis Modulo ω-Categorical Structures

ocLTL:LTL可实现性与合成模ω-范畴结构

Ohad Asor

专题命中 其他安全 :safety(abstract);AI safety(abstract)

AI总结 ocLTL在ω-范畴结构下研究LTL+P的可实现性与合成,通过将数据子公式替换为有限析取式,保持2-EXPTIME复杂度,应用于原子布尔代数与林德布拉德-塔斯基代数,并关联到AI安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15334 2026-05-18 cs.LG cs.AI cs.CL cs.SE 67%

From I/O to Code with Discovery Agent

从输入输出到代码:发现代理

Yihong Dong, Jiaru Qian, Haoran Zhang, Peixu Wang, Binhua Li, Zhi Jin, Yongbin Li, Ge Li, Xiaokang Yang, Xue Jiang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Wuhan University(武汉大学) Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学) Shanghai Jiaotong University(上海交通大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DIO-Agent,通过将IO2Code视为离散程序空间的进化搜索,利用LLM作为突变算子,结合执行误差信号指导突变,解决从输入输出行为合成代码的难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18104 2026-05-15 cs.CL cs.AI cs.LG 67%

Training and Evaluating Language Models with Template-based Data Generation

基于模板的数据生成训练和评估语言模型

Yifan Zhang

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Template-based Data Generation方法,通过生成高质量数学问题及可验证解,解决大语言模型在复杂推理任务中的数据稀缺问题,并引入TemplateMath Part I: TemplateGSM数据集。

Comments Published in ICLR 2025 DATA-FM Workshop. Project Page: https://github.com/iiis-ai/TemplateMath

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01153 2026-05-05 cs.HC 67%

Toward a Unified Framework for Collaborative Design of Human-AI Interaction

迈向人机交互协作设计的统一框架

Ankur Bhatt, Sven Mayer

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 本文提出统一框架整合多模态对齐、交互导向的可解释性及用户代理,通过协作设计与增强现实仓库机器人场景验证,提升人机交互透明度与用户控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21110 2026-04-28 cs.AI cs.CL cs.CR cs.CY 67%

Beyond Context: Large Language Models' Failure to Grasp Users' Intent

超越上下文:大型语言模型对用户意图的把握失败

Ahmed M. Hussain, Salahuddin Salahuddin

机构 * KTH Royal Institute of Technology Network Systems Security (NSS) Group(皇家理工学院网络系统安全小组)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究指出大型语言模型在理解上下文和识别用户意图方面存在缺陷,导致安全机制被恶意用户利用,需转向以上下文理解和意图识别为核心的安全能力。

Comments 22 pages and 23 figures; updated authors list and revised manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18943 2026-04-22 cs.AI cs.CL cs.HC cs.IR cs.LG 67%

Personalized Benchmarking: Evaluating LLMs by Individual Preferences

个性化基准测试:通过个体偏好评估LLM

Cristina Garbacea, Heran Wang, Chenhao Tan

机构 * University of Chicago(芝加哥大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出个性化LLM基准测试,通过ELO评分和Bradley-Terry系数分析115名用户对LLM的排名差异,发现个体偏好与聚合排名差异显著,强调开发个性化基准的重要性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18228 2026-04-21 cs.SE 67%

Towards an Agentic LLM-based Approach to Requirement Formalization from Unstructured Specifications

迈向基于代理的LLM方法:从非结构化规范中提取需求形式化

Alberto Tagliaferro, Bruno Guindani, Livia Lestingi, Matteo Rossi

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 本文提出基于代理的方法,从非结构化规范中自动生成符合验证要求的形式化属性,通过提取、过滤和翻译三个模块,实现语义对齐,实验表明其在三个场景中准确率达77.8%。

Comments Accepted at the AIPV 2026 workshop (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18087 2026-04-21 cs.CL cs.AI cs.CY 67%

Mix and Match: Context Pairing for Scalable Topic-Controlled Educational Summarisation

混合与匹配:用于可扩展主题控制教育摘要的上下文配对

Nathikan Yodthapa, Thanapong Intharah, Sahan Bulathwela

机构 * Visual Intelligence Laboratory, Department of Statistics, Faculty of Science, Khon Kaen University, Khon Kaen 40002, Thailand(科纳坎大学科学学院统计学系视觉智能实验室) Centre for Artificial Intelligence, Department of Computer Science, University College London, London WC1E 6BT, The United Kingdom(伦敦大学学院人工智能中心计算机科学系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出一种数据增强策略,通过跨文档上下文配对提升小语言模型的主题控制摘要能力,实验表明增强规模增加可提升模型表现,且在参数和训练数据较少时仍能竞争性地表现优异。

Comments To be published at the International Conference on Artificial Intelligence in Education (AIED'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16622 2026-04-21 cs.CL cs.AI cs.LG 67%

Aligning Backchannel and Dialogue Context Representations via Contrastive LLM Fine-Tuning

通过对比式LLM微调对齐反馈通道和对话上下文表示

Livia Qian, Gabriel Skantze

机构 * Department for Speech, Music and Hearing(语音、音乐与听觉系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出双阶段框架,通过对话转录微调大语言模型获取上下文表示,并学习对话上下文和反馈通道表示的联合嵌入空间,实验表明学习的投影显著提升了上下文-反馈通道检索性能。

Comments Association for Computational Linguistics (ACL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03897 2026-04-17 cs.RO cs.AI cs.CL cs.HC cs.LG 67%

IROSA: Interactive Robot Skill Adaptation using Natural Language

IROSA: 基于自然语言的交互机器人技能适应

Markus Knauer, Samuel Bustamante, Thomas Eiband, Alin Albu-Schäffer, Freek Stulp, João Silvério

机构 * German Aerospace Center (DLR), Institute of Robotics and Mechatronics (RMC)(德国航空航天中心(DLR)机器人与机电研究所) School of Computation, Information and Technology (CIT), Technical University of Munich (TUM)(计算、信息与技术学院(CIT),慕尼黑技术大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出IROSA框架,利用预训练大语言模型实现开放词汇技能适应,通过工具架构在语言模型与机器人硬件间保持抽象层,无需微调即可通过自然语言指令调整机器人技能。

Comments Accepted IEEE Robotics and Automation Letters (RA-L) journal, 8 pages, 5 figures, 3 tables, 1 listing. Code available: https://github.com/DLR-RM/IROSA

Journal ref IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23061 2026-04-15 cs.IR cs.AI cs.CL cs.DB cs.LG 67%

MoDora: Tree-Based Semi-Structured Document Analysis System

MoDora:基于树的半结构化文档分析系统

Bangrui Xu, Qihang Yao, Zirui Tang, Xuanhe Zhou, Yeye He, Shihan Yu, Qianqian Xu, Bin Wang, Guoliang Li, Conghui He, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Microsoft Research(微软研究院) Beihang University(北航) Shanghai AI Lab(上海人工智能实验室) Tsinghua University(清华大学) Institute for Clarity in Documentation(文档清晰性研究所) Inria Paris-Rocquencourt(Inria巴黎-罗quentcourt研究中心) East China Normal University(华东师范大学) Scientific Writing Academy(科学写作学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MoDora通过局部对齐聚合策略和组件相关树结构,提升半结构化文档的分析能力,实验表明其在准确性上优于基线方法。

Comments Extension of our SIGMOD 2026 paper. Please refer to source code available at https://github.com/weAIDB/MoDora

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13047 2026-04-14 cs.CL cs.AI cs.LG 67%

Multi-Model Synthetic Training for Mission-Critical Small Language Models

多模型合成训练用于关键任务小型语言模型

Nolan Platt, Pragyansmita Nayak

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用多模型生成技术,将AIS数据转化为问答对,训练出准确率达75%的低成本小型模型,为专业领域AI应用提供可复现的合成数据生成框架。

Comments 8 pages. Accepted as a full paper to the 3rd International Conference on Foundation and Large Language Models (IEEE FLLM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08942 2026-04-14 cs.CV cs.AI cs.CL cs.LG 67%

BiCLIP: Domain Canonicalization via Structured Geometric Transformation

BiCLIP:通过结构几何变换实现领域规范化

Pranav Mantini, Shishir K. Shah

机构 * University of Houston(休斯顿大学) The University of Oklahoma(俄克拉荷马大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BiCLIP通过结构几何变换提升跨模态对齐,利用少量锚点样本实现领域规范化,实验表明其在11个基准测试中均取得最优性能。

Comments Accepted at Domain Generalization: Evolution, Breakthroughs, and Future Horizons Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06571 2026-04-09 cs.CL cs.AI cs.IR cs.LG 67%

LLM-based Schema-Guided Extraction and Validation of Missing-Person Intelligence from Heterogeneous Data Sources

基于大型语言模型的异构数据源中缺失人员情报提取与验证方案

Joshua Castillo, Ravi Mukkamala

机构 * Old Dominion University(欧道明大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Guardian Parser Pack,通过AI驱动的解析与规范化流程,将多源调查文档统一为符合模式的表示,提升缺失人员情报的提取与验证效率,同时展示系统架构及性能评估结果。

Comments 9 pages, 6 figures. Accepted at International Conference on Intelligent Digitization of Systems and Services (IDSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02459 2026-04-06 cs.LG cs.AI cs.CL 67%

On the Geometric Structure of Layer Updates in Deep Language Models

深度语言模型中层更新的几何结构研究

Jun-Sik Yoo

机构 * Institute of Basic Science, Korea University(韩国大学基础科学研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究深度语言模型中层更新的几何结构,发现层更新可分解为主导的tokenwise组件和一个几何上不同的残差部分,残差对输出扰动有显著影响。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29593 2026-04-01 physics.soc-ph q-fin.CP 67%

Be Water: An Evolutionary Proof for Trend-Following

顺势而为:一种进化证明的跟风策略

Yijia Chen

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 本文通过构建大规模基于代理的模型,探讨了金融市场中跟风策略的进化可行性,发现顺应市场趋势的策略比逆势策略更具生存优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27356 2026-03-31 cs.CL cs.AI cs.CY 67%

Culturally Adaptive Explainable LLM Assessment for Multilingual Information Disorder: A Human-in-the-Loop Approach

文化适应性可解释LLM评估用于多语言信息紊乱:一种人机协作方法

Maziar Kianimoghadam Jouneghani

机构 * University of Turin(都灵大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出一种人机协作框架,通过本地语言标注者生成的解释性理由,评估LLM在多语言信息紊乱中的表现,提升模型的文化适应性和可解释性。

Comments 9 pages, 3 figures, 1 table. Accepted to the Information Disorder Workshop at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19574 2026-03-23 cs.HC cs.AI cs.CL cs.CY cs.SI 67%

AI Psychosis: Does Conversational AI Amplify Delusion-Related Language?

AI精神病:对话AI是否会放大妄想相关语言?

Soorya Ram Shimgekar, Vipin Gunda, Jiwon Kim, Violeta J. Rodriguez, Hari Sundaram, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究探讨对话AI对妄想相关语言的影响,通过模拟用户和三种模型家族分析妄想语言的变化,发现高妄想用户对话中妄想得分持续上升,而AI响应可有效降低此趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14664 2026-03-17 cs.AI cs.CL cs.CY 67%

Punctuated Equilibria in Artificial Intelligence: The Institutional Scaling Law and the Speciation of Sovereign AI

人工智能中的突变平衡:制度扩展定律与主权人工智能的物种分化

Mark Baciak, Thomas A. Cellucci, Deanna M. Falkowski

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文挑战人工智能发展连续进步的假设,提出基于生物进化突变平衡理论,揭示AI发展通过停滞期与快速转型交替的非单调模式,提出制度扩展定律及主权AI的物种分化概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08448 2026-03-17 cs.HC cs.AI cs.CL cs.LG 67%

A prospective clinical feasibility study of a conversational diagnostic AI in an ambulatory primary care clinic

前瞻性临床可行性研究:一种对话式诊断AI在门诊初级保健诊所中的应用

Peter Brodeur, Jacob M. Koshy, Anil Palepu, Khaled Saab, Ava Homiar, Roma Ruparel, Charles Wu, Ryutaro Tanno, Joseph Xu, Amy Wang, David Stutz, Wei-Hung Weng, Hannah M. Ferrera, David Barrett, Lindsey Crowley, Jihyeon Lee, Spencer E. Rittner, Ellery Wulczyn, Selena K. Zhang, Elahe Vedadi, Christine G. Kohn, Kavita Kulkarni, Vinay Kadiyala, Sara Mahdavi, Wendy Du, Jessica M. Williams, David Feinbloom, Renee Wong, Tao Tu, Petar Sirkovic, Alessio Orlandi, Christopher Semturs, Yun Liu, Juraj Gottweis, Dale R. Webster, Joëlle Barral, Katherine Chou, Pushmeet Kohli, Avinatan Hassidim, Yossi Matias, James Manyika, Rob Fields, Jonathan X. Li, Marc L. Cohen, Vivek Natarajan, Mike Schaekermann, Alan Karthikesalingam, Adam Rodman

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了基于大语言模型的对话式AI在真实临床环境中的可行性,评估了其安全性、质量和临床推理能力,并展示了AI在初级保健中的初步应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13884 2026-03-17 cs.CV 67%

SCoCCA: Multi-modal Sparse Concept Decomposition via Canonical Correlation Analysis

SCoCCA: 通过典型相关分析进行多模态稀疏概念分解

Ehud Gordon, Meir Yossef Levi, Guy Gilboa

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 本文提出SCoCCA,通过典型相关分析实现多模态稀疏概念分解,提升跨模态对齐与可解释性,实现概念发现的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09894 2026-03-17 cs.AI cs.CY cs.LG 67%

Beyond AlphaEarth: Toward Human-Centered Geospatial Foundation Models via POI-Guided Contrastive Learning

超越AlphaEarth:通过POI引导对比学习实现以人为中心的地理空间基础模型

Junyuan Liu, Quan Qin, Guangsheng Dong, Xinglei Wang, Jiazhuang Feng, Zichao Zeng, Tao Cheng

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出AETHER框架,通过POI引导的多模态对齐,将AlphaEarth与以人为中心的城市分析结合,提升地理空间表示的可解释性与语言可访问性。

详情

展开后加载摘要…

URL PDF HTML 收藏