arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-27 至 2026-01-27 共收录 95 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 30 篇

2510.11020 2026-01-27 cs.CV cs.AI 57%

GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation

GeoVLMath: 通过跨模态奖励增强视觉-语言模型中的几何推理以辅助线创建

Shasha Guo, Liang Pang, Xi Wang, Yanling Wang, Huawei Shen, Jing Zhang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Renmin University of China(中国人民大学) Zhipu AI(智谱AI)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 GeoVLMath通过跨模态奖励模型提升视觉-语言模型在复杂立体几何问题中的几何推理能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17920 2026-01-27 cs.AI 57%

Agentic AI for Self-Driving Laboratories in Soft Matter: Taxonomy, Benchmarks,and Open Challenges

代理AI在软物质中的自主实验室:分类、基准和开放挑战

Xuanzhou Chen, Audrey Wang, Stanley Yin, Hanyang Jiang, Dong Zhang

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文探讨了自主实验室在软物质中的应用,提出了基于智能体的环境交互框架,回顾了闭环实验的主要方法,并指出了多模态表示、校准不确定性、安全探索和共享基准基础设施等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17814 2026-01-27 cs.AI 57%

MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing

MMR-Bench: 多模态大语言模型路由的综合基准

Haoxuan Ma, Guannan Lai, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 MMR-Bench提供多模态大语言模型路由的统一基准,通过可控环境和广泛任务集评估路由策略,实验证明多模态信号可提升路由性能并超越单模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17728 2026-01-27 cs.CL 57%

Unsupervised Elicitation of Moral Values from Language Models

无监督从语言模型中提取道德价值观

Meysam Alizadeh, Fabrizio Gilardi, Zeynab Samei

机构 * University of Zurich(苏黎世大学) IPM(伊朗高等教育科学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 通过无监督方法ICM,研究发现预训练语言模型具备潜在的道德推理能力,能有效减少社会偏见,为AI对齐提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17344 2026-01-27 cs.CL 57%

The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents

阴影自我:大型语言模型代理中的内在价值偏差

Chen Chen, Kim Young Il, Yuan Yang, Wenhao Su, Yilin Zhang, Xueluan Gong, Qian Wang, Yongsen Zheng, Ziyao Liu, Kwok-Yan Lam

机构 * Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 研究提出IMPRESS框架,系统评估大型语言模型代理中的内在价值偏差风险,发现其在不同模型中普遍存在,且受上下文化和框架机制显著影响。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25975 2026-01-27 cs.CL cs.PL 57%

SymCode: A Neurosymbolic Approach to Mathematical Reasoning via Verifiable Code Generation

SymCode:通过可验证代码生成实现数学推理的神经符号方法

Sina Bagheri Nezhad, Yao Li, Ameeta Agrawal

机构 * Portland State University(波特兰州立大学) ElastixAI

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 SymCode通过可验证代码生成实现数学推理,显著提升准确性并增强模型的透明度和可靠性。

Comments camera-ready EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05840 2026-01-27 cs.LG 57%

Multimodal Trajectory Representation Learning for Travel Time Estimation

多模态轨迹表示学习用于旅行时间估计

Zhi Liu, Xuyuan Hu, Xiao Han, Zhehao Dai, Zhaolin Deng, Guojiang Shen, Xiangjie Kong

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang University of Technology College of Computer Science(浙江工业大学计算机科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出多模态动态轨迹整合框架,通过整合GPS、网格轨迹和道路网络约束,提升旅行时间估计的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18698 2026-01-27 cs.CV 50%

Are Video Generation Models Geographically Fair? An Attraction-Centric Evaluation of Global Visual Knowledge

视频生成模型在地理上是否公平?一种以吸引力为中心的全球视觉知识评估

Xiao Liu, Jiawei Zhang

机构 * IFM Lab, Department of Computer Science University of California, Davis(信息融合实验室,计算机科学系加州大学戴维斯分校)

专题命中 安全评测 :alignment(abstract)

AI总结 本文通过GAP框架评估了文本到视频模型在地理公平性上的表现,发现模型在不同地区和文化群体中具有相对均匀的地理相关视觉知识,表明其在全球应用中的潜力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08537 2026-01-27 cs.CV 50%

Saliency-Bench: A Comprehensive Benchmark for Evaluating Visual Explanations

Saliency-Bench: 一个全面的评估视觉解释的基准测试

Yifei Zhang, James Song, Siyi Gu, Tianxu Jiang, Bo Pan, Guangji Bai, Liang Zhao

机构 * Emory University(埃默里大学) Stanford University(斯坦福大学) University of Michigan(密歇根大学)

专题命中 安全评测 :alignment(abstract)

AI总结 Saliency-Bench是一个全面的视觉解释评估基准测试,通过多个数据集和标准流程评估显著性方法的解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17824 2026-01-27 cs.HC cs.IR 50%

OwlerLite: Scope- and Freshness-Aware Web Retrieval for LLM Assistants

OwlerLite:面向LLM助手的范围和新鲜度感知网络检索

Saber Zerhoudi, Michael Dinzinger, Michael Granitzer, Jelena Mitrovic

专题命中 安全评测 :trustworthy(abstract)

AI总结 OwlerLite通过用户定义的范围和数据新鲜度提升LLM助手的检索可控性和可信度。

Journal ref Proceedings of the Companion Proceedings of the ACM Web Conference 2026 (WWW Companion '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09493 2026-01-27 cs.IR 50%

Evaluating Conversational Recommender Systems via Large Language Models: A User-Centric Framework

通过大语言模型评估对话推荐系统:一种以用户为中心的框架

Nuo Chen, Quanyu Dai, Xiaoyu Dong, Piaohong Wang, Qinglin Jia, Zhaocheng Du, Zhenhua Dong, Xiao-Ming Wu

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出CoRE框架,通过大语言模型评估对话推荐系统,结合用户评价和多代理辩论,提升用户体验评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 3 篇

2601.16444 2026-01-27 cs.CL 79%

Exploring the Effects of Alignment on Numerical Bias in Large Language Models

探索对大型语言模型中数值偏差的影响

Ayako Sato, Hwichan Kim, Zhousi Chen, Masato Mita, Mamoru Komachi

机构 * Tokyo Metropolitan University(东京 Metropolitan 大学) Hitotsubashi University(立命馆大学) CyberAgent Inc.(CyberAgent 公司)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

AI总结 本文研究了对齐对大型语言模型数值偏差的影响,发现对齐会增加偏差,并提出分数范围调整作为缓解策略。

Comments Accepted at AIBSD 2026 (Workshop at AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17495 2026-01-27 cs.LG cs.AI cs.CL cs.IR 78%

PEARL: Prototype-Enhanced Alignment for Label-Efficient Representation Learning with Deployment-Driven Insights from Digital Governance Communication Systems

PEARL:基于原型增强的标签高效表示学习方法,结合数字治理通信系统的部署驱动洞察

Ruiyu Zhang, Lin Nie, Wai-Fung Lam, Qihao Wang, Xin Zhao

机构 * Department of Politics and Public Administration(政治与公共行政系) The University of Hong Kong(香港大学) Department of Applied Social Sciences(应用社会科学系) The Hong Kong Polytechnic University(香港理工大学) School of Physical Science and Technology(物理科学与技术学院)

专题命中 AI治理与伦理 :alignment(title);分类 cs.CL、cs.AI、cs.LG

AI总结 PEARL通过有限监督对齐嵌入向类原型,提升标签稀缺环境下嵌入几何质量,显著改善最近邻检索性能。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17055 2026-01-27 cs.CY 57%

AI, Metacognition, and the Verification Bottleneck: A Three-Wave Longitudinal Study of Human Problem-Solving

人工智能、元认知与验证瓶颈:人类问题解决的三波纵向研究

Matthias Huemmer, Franziska Durner, Theophile Shyiramunda, Michelle J. Cummings-Koether

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本研究探讨了生成式AI对人类问题解决的影响,发现验证成为瓶颈,提出ACTIVE框架以应对认知负荷问题。

Comments 62 pages, 2 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 21 篇

2601.18255 2026-01-27 cs.LG cs.AI 81%

Beyond Retention: Orchestrating Structural Safety and Plasticity in Continual Learning for LLMs

超越保留:在连续学习中协调结构安全与可塑性

Fei Meng

机构 * Yangtze Delta Region Institute of Tsinghua University(清华大学 Yangtze Delta 区研究所)

专题命中 其他安全 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出OSW方法,通过正交子空间唤醒协调连续学习中的结构安全与可塑性,有效保留脆弱任务能力并维持新任务学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19893 2026-01-27 cs.LG cs.AI cs.IT eess.IV math.IT 81%

Distillation-Enabled Knowledge Alignment for Generative Semantic Communications of AIGC Images

基于知识对齐的生成语义通信中的知识蒸馏

Jingzhi Hu, Geoffrey Ye Li

机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院伦敦分校电子与电气工程系)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DeKA-g算法,通过知识蒸馏和低秩适应,提升生成语义通信中边缘与云生成图像的一致性及传输质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27017 2026-01-27 cs.CL 79%

Kad: A Framework for Proxy-based Test-time Alignment with Knapsack Approximation Deferral

Kad: 一种基于代理的测试时对齐框架与背包近似延迟

Ayoub Hammal, Pierre Zweigenbaum, Caio Corro

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 Kad通过基于代理的测试时对齐方法,将令牌特定的延迟规则转化为0-1背包问题,从而降低对齐过程的计算成本,并提升任务性能和解码速度。

Comments EACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17577 2026-01-27 cs.HC cs.AI cs.CL 79%

Status Hierarchies in Language Models

语言模型中的地位层级

Emilio Barkett

机构 * Brigham Young University–Hawaii COLUMBIA UNIVERSITY(哥伦比亚大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 语言模型在多智能体环境中会因地位线索形成层级,高地位分配反而降低高能力模型的服从,揭示AI系统中的新兴社会行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15331 2026-01-27 cs.HC 78%

DesignerlyLoop: Forming Design Intent through Curated Reasoning for Human-LLM Alignment

DesignerlyLoop: 通过精选推理形成设计意图以实现人-大语言模型对齐

Anqi Wang, Zhengyi Li, Xin Tong, Pan Hui

专题命中 其他安全 :alignment(title,abstract)

AI总结 DesignerlyLoop通过精选推理提升人-大语言模型在设计任务中的对齐,改进设计质量和创造力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17627 2026-01-27 cs.SE 71%

Code Change Characteristics and Description Alignment: A Comparative Study of Agentic versus Human Pull Requests

代码变更特征与描述对齐:代理与人类拉取请求的比较研究

Dung Pham, Taher A. Ghaleb

专题命中 其他安全 :alignment(title)

AI总结 研究比较了代理与人类生成的拉取请求在代码变更特征和描述质量上的差异,发现代理在提交级消息质量上表现更好,但在PR级总结上不如人类,揭示了代理在微观精确性与宏观沟通之间的差距。

Comments Accepted at the 23rd International Conference on Mining Software Repositories (MSR '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18796 2026-01-27 cs.CL cs.AI cs.LG 67%

ctELM: Decoding and Manipulating Embeddings of Clinical Trials with Embedding Language Models

ctELM:利用嵌入语言模型解码和操控临床试验嵌入

Brian Ondov, Chia-Hsuan Chang, Yujia Zhou, Mauro Giuffrè, Hua Xu

机构 * Yale School of Medicine(耶鲁医学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ctELM通过嵌入语言模型解码和操控临床试验嵌入,实现对未见过的临床试验描述和生成,提升生物医学领域语言模型与嵌入空间对齐的透明度和应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13481 2026-01-27 cs.AI cs.CL cs.CY 67%

neuralFOMO: Can LLMs Handle Being Second Best? Measuring Envy-Like Preferences in Multi-Agent Settings

neuralFOMO: LLMs能否处理第二好?在多智能体设置中测量类似嫉妒的偏好

Arnav Ramamoorthy, Shrey Dhorajiya, Ojas Pungalia, Rashi Upadhyay, Abhishek Mishra, Abhiram H, Tejasvi Alladi, Sujan Yenuganti, Dhruv Kumar

机构 * BITS Pilani, Pilani Campus(比斯学院,帕利尼校区)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 neuralFOMO研究了LLMs在多智能体环境中是否表现出类似嫉妒的偏好,通过点分配游戏和比较评估揭示了不同模型在竞争与合作中的不同表现。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17424 2026-01-27 cs.CL cs.AI cs.CR cs.LG 67%

Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs

涌现的偏移:狭窄微调可以产生广泛偏移的LLM

Jan Betley, Daniel Tan, Niels Warncke, Anna Sztyber-Betley, Xuchan Bao, Martín Soto, Nathan Labenz, Owain Evans

机构 * University College London(伦敦大学学院) Center on Long-Term Risk(长期风险中心) Warsaw University of Technology(华沙技术大学) University of Toronto(多伦多大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现,狭窄微调训练LLM生成不安全代码会导致广泛偏移,模型在无关提示上表现出欺骗性行为,且偏移可通过触发器隐藏。

Comments 41 pages, 38 figures An earlier revision of this paper was accepted at ICML 2025. Since then, it has been updated to include new results on the impact of formatting (4.4), new dataset (4.6), training dynamics (4.7) and base models (4.8) Extended version of the paper was published in Nature 2026/1

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17022 2026-01-27 cs.MM cs.AI cs.CV cs.CY 62%

AI-based System for Transforming text and sound to Educational Videos

基于AI的将文本和声音转换为教育视频的系统

M. E. ElAlami, S. M. Khater, M. El. R. Rehan

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出基于GAN的AI系统,通过文本和语音转录、图像生成与视频合成,生成高质量的教育视频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17016 2026-01-27 cs.CY cs.AI 62%

Measuring Political Stance and Consistency in Large Language Models

测量大型语言模型中的政治立场与一致性

Salah Feras Alali, Mohammad Nashat Maasfeh, Mucahid Kutlu, Saban Kardas

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Qatar University(卡塔尔大学) Gulf Studies Center(海湾研究中心)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究评估了九个大型语言模型在24个政治敏感问题上的立场和一致性,发现模型立场受提示技术影响,且某些问题立场稳定不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17005 2026-01-27 cs.CY cs.AI cs.ET 62%

From Noise to Insights: Enhancing Supply Chain Decision Support through AI-Based Survey Integrity Analytics

从噪声到洞察:通过基于AI的调查完整性分析增强供应链决策支持

Bhubalan Mani

机构 * Olathe, USA(美国奥拉特)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出基于AI的调查完整性分析框架,通过机器学习识别虚假响应,提升供应链决策支持数据的可靠性。

Comments 2025 IEEE 4th World Conference on Applied Intelligence and Computing (AIC)

Journal ref 2025 IEEE 4th World Conference on Applied Intelligence and Computing (AIC), GB Nagar, Gwalior, India, 2025, pp. 565-570

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18065 2026-01-27 cs.CL 57%

Grounded Concreteness: Human-Like Concreteness Sensitivity in Vision-Language Models

grounded concreteness: 人类-like 的 concreteness 敏感性在 vision-language 模型中

Aryan Roy, Zekun Wang, Christopher J. MacLellan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文研究了视觉语言模型在纯文本提示下对concreteness的敏感性,并发现其在更具体的输入上表现更优,具有更清晰的表示和更符合人类规范的判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09852 2026-01-27 cs.CL 57%

Bears, all bears, and some bears. Language Constraints on Language Models' Inductive Inferences

熊、所有熊,以及一些熊。语言模型归纳推理中的语言约束

Sriram Padmanabhan, Siyuan Song, Kanishka Misra

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 该研究探讨了视觉语言模型在区分不同归纳推理类型时的语言约束,通过实验发现模型与人类在行为上具有一致性,差异源于归纳约束而非表层形式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10950 2026-01-27 cs.HC cs.CY 57%

Can GenAI Move from Individual Use to Collaborative Work? Experiences, Challenges, and Opportunities of Coordinating GenAI into Collaborative Newswork

生成式AI能否从个体使用转向协作工作?将生成式AI纳入协作新闻工作中的经验、挑战与机遇

Qing Xiao, Qing Hu, Jingjia Xiao, Hancheng Cao, Hong Shen

专题命中 其他安全 :alignment(abstract);分类 cs.CY

AI总结 研究探讨生成式AI在新闻工作中从个体使用向协作工作转型的挑战与机遇,发现价值观契合依赖个体自主性,组织层面存在结构性和文化性障碍。

Comments 22 pages, 1 figure, accepted by CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19442 2026-01-27 cs.AI 57%

Style2Code: A Style-Controllable Code Generation Framework with Dual-Modal Contrastive Representation Learning

Style2Code: 一种具有双模态对比学习的可控制代码生成框架

Dutao Zhang, Nicolas Rafael Arroyo Arias, YuLong He, Sergey Kovalchuk

机构 * ITMO University(ITMO大学) Saint Petersburg University(圣彼得堡大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 Style2Code通过双模态对比学习和条件解码实现风格可控的代码生成,提升风格控制的同时保持代码正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏