arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-30 至 2026-01-30 共收录 55 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 23 篇

2601.21947 2026-01-30 cs.AI 57%

ToolWeaver: Weaving Collaborative Semantics for Scalable Tool Use in Large Language Models

ToolWeaver: 为大语言模型中的可扩展工具使用编织协作语义

Bowen Fang, Wen Ye, Yunyue Su, Jinghao Zhang, Qiang Liu, Yesheng Liu, Xin Sun, Shu Wu, Jiabing Yang, Baole Wei, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR),自动化研究所,中国科学院(CASIA)) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 ToolWeaver通过编码工具为层次序列,解决大语言模型中工具使用中的语义和可扩展性问题,提升工具协作学习的效率与效果。

Comments 10pages, 12 figures, Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21802 2026-01-30 cs.AI 57%

A Unified XAI-LLM Approach for EndotrachealSuctioning Activity Recognition

面向气管吸引活动识别的统一XAI-LLM方法

Hoang Khang Phan, Quang Vinh Dang, Noriyo Colley, Christina Garcia, Nhat Tan Le

机构 * Dept. of Biomedical Engineering(生物医学工程系) Manning College of Information(信息与计算机科学学院) Faculty of Health Science(健康科学学院) Kyushu Institute of Technology(九州工业大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种统一的XAI-LLM框架,用于气管吸引活动识别,通过LLM实现时空活动识别和可解释反馈,提升培训效率和患者安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21786 2026-01-30 cs.CV cs.AI cs.GR 57%

Synthetic-to-Real Domain Bridging for Single-View 3D Reconstruction of Ships for Maritime Monitoring

单视图3D船舶重建用于海上监控的合成到现实领域桥梁

Borja Carrillo-Perez, Felix Sattler, Angel Bueno Rodriguez, Maurice Stephan, Sarah Barnes

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种基于合成数据的单视图3D船舶重建方法,通过高效网络和领域迁移技术,实现海上监控的实时3D可视化。

Journal ref Applications of Machine Learning 2025, Proc. of SPIE Vol. 13606, 136061G 2025 Published by SPIE 0277-786X

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19236 2026-01-30 cs.CL 57%

Evaluating Text Creativity across Diverse Domains: A Dataset and Large Language Model Evaluator

在不同领域评估文本创造力:一个数据集和大语言模型评估器

Qian Cao, Xiting Wang, Yuzhuo Yuan, Yahui Liu, Fang Luo, Ruihua Song

机构 * Renmin University of China(中国人民大学) Beijing Normal University(北京师范大学) Kuaishou Technology(快手科技)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种基于CreataSet数据集的CrEval评估器,通过结合人类和合成数据提升大语言模型的创造力评估效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21403 2026-01-30 cs.AI cs.MA 57%

DataCross: A Unified Benchmark and Agent Framework for Cross-Modal Heterogeneous Data Analysis

DataCross: 一个统一的基准和代理框架,用于跨模态异构数据分析

Ruyi Qi, Zhou Liu, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 DataCross提出一个统一的基准和代理框架,用于跨模态异构数据分析,通过多步骤联合推理提升事实性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21189 2026-01-30 cs.CR cs.AI 57%

Adaptive and Robust Cost-Aware Proof of Quality for Decentralized LLM Inference Networks

自适应和稳健的成本感知质量证明用于去中心化大语言模型推理网络

Arther Tian, Alex Ding, Frank Chen, Simon Wu, Aaron Chan

机构 * DGrid AI

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种自适应和稳健的成本感知质量证明机制,通过鲁棒聚合规则和动态信任权重提升共识一致性,减少对抗攻击影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21128 2026-01-30 cs.AI 57%

Beyond a Single Reference: Training and Evaluation with Paraphrases in Sign Language Translation

超越单一参考:在手语翻译中使用同义词进行训练和评估

Václav Javorek, Tomáš Železný, Alessa Carbo, Marek Hrúz, Ivan Gruber

机构 * University of West Bohemia(西波希米亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究提出通过生成同义词参考提升手语翻译评估的准确性,引入BLEUpara度量标准并验证其与人类判断的一致性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16740 2026-01-30 cs.HC 50%

Evaluating Generative AI in the Lab: Methodological Challenges and Guidelines

在实验室中评估生成式AI:方法学挑战与指南

Hyerim Park, Khanh Huynh, Malin Eiband, Jeremy Dillmann, Sven Mayer, Michael Sedlmair

专题命中 安全评测 :alignment(abstract)

AI总结 本文探讨了在实验室环境中评估生成式AI的方法学挑战,提出了五个指南和十八项建议,以帮助研究人员设计更透明和稳健的评估研究。

Comments 18 pages, 3 figures, IUI '26 (the 31st International Conference on Intelligent User Interfaces)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12448 2026-01-30 cs.SE 50%

Evaluating Large Language Models for Time Series Anomaly Detection in Aerospace Software

评估大型语言模型在航空航天软件时间序列异常检测中的应用

Yang Liu, Yixing Luo, Xiaofeng Li, Xiaogang Dong, Bin Gu, Zhi Jin

专题命中 安全评测 :safety(abstract)

AI总结 本文提出ATSADBench基准,评估大型语言模型在航空航天软件时间序列异常检测中的性能,发现其在单变量任务表现良好,但多变量任务效果欠佳,且RAG策略可能加剧假警报问题。

Comments This paper has been accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14570 2026-01-30 cs.SD eess.AS 50%

AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation

AudioEval: 文本到音频生成的自动双视角和多维度评估

Hui Wang, Jinghua Zhao, Junyang Cheng, Cheng Liu, Yuhang Jia, Haoqin Sun, Jiaming Zhou, Yong Qin

机构 * College of Computer Science, Nankai University, Tianjin, China(南开大学计算机科学学院)

专题命中 安全评测 :alignment(abstract)

AI总结 AudioEval通过大规模数据集和Qwen-DisQA基线,提供文本到音频生成的多维度自动评估方法,支持模型性能比较与评估体系优化。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 2 篇

2601.21226 2026-01-30 cs.AI 57%

Delegation Without Living Governance

无生命治理的委托

Wolfgang Rohde

机构 * AiSuNe Foundation(AiSuNe基金会)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文探讨了在代理AI系统决策成为运行时决策的情况下,如何通过运行时治理(治理双胞胎)维持人类在社会、经济和政治结果塑造中的相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12193 2026-01-30 cs.CY 57%

The Narrow Depth and Breadth of Corporate Responsible AI Research

企业负责任的人工智能研究的深度和广度

Nur Ahmed, Amit Das, Kirsten Martin, Kawshik Banerjee

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 研究揭示企业负责任的人工智能研究存在深度和广度不足的问题,需加强公开参与以提升社会影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 13 篇

2411.07042 2026-01-30 cs.HC cs.AI cs.CL cs.CY 67%

Minion: A Technology Probe to Explore How Users Negotiate Harmful Value Conflicts with AI Companions

Minion:一种技术探测器,用于探索用户如何与AI伙伴协商有害的价值冲突

Xianzhe Fan, Qing Xiao, Xuhui Zhou, Yuran Su, Zhicong Lu, Maarten Sap, Hong Shen

机构 * The University of Hong Kong(香港大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) Tsinghua University(清华大学) Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 Minion通过探测用户与AI伙伴协商有害价值冲突的过程,揭示了设计中需平衡用户责任与AI安全的挑战。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22009 2026-01-30 cond-mat.mtrl-sci cs.AI cs.LG physics.comp-ph 62%

MEIDNet: Multimodal generative AI framework for inverse materials design

MEIDNet: 多模态生成式AI框架用于反向材料设计

Anand Babu, Rogério Almeida Gouvêa, Pierre Vandergheynst, Gian-Marco Rignanese

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 MEIDNet通过多模态生成式AI框架实现反向材料设计,利用对比学习提升学习效率,生成低带隙钙钛矿结构并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23471 2026-01-30 cs.CL cs.AI 62%

Discovering Multi-Scale Semantic Structure in Text Corpora Using Density-Based Trees and LLM Embeddings

利用基于密度的树和大语言模型嵌入发现文本语料库的多尺度语义结构

Thomas Haschka, Joseph Bakarji

机构 * E020-04 Service Unit of High Performance Computing, DataLab, Campus IT, Technische Universität Wien(技术大学维也纳高性能计算服务单元,数据实验室,校园IT) Department of Mechanical Engineering, American University of Beirut(贝鲁特美国大学机械工程系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于密度的树和大语言模型嵌入的方法,用于发现文本语料库的多尺度语义结构,通过层次密度建模揭示主题之间的结构关系。

Comments 23 pages, 10 figures, further interactive visualizations available on https:// genealogy.sematlas.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17866 2026-01-30 cs.LG cs.AI 62%

Understanding Post-Training Structural Changes in Large Language Models

理解大型语言模型的训练后结构变化

Xinyu He, Xianghui Cao

机构 * School of Automation, Southeast University, Nanjing, China(自动化学院,东南大学,南京,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过SVD分析揭示了大型语言模型训练后参数空间的结构变化,发现奇异值缩放和奇异向量旋转机制,为理解训练后调节机制提供了新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04177 2026-01-30 cs.CL cs.LG stat.ML 62%

Scaling Laws for Downstream Task Performance of Large Language Models

大语言模型下游任务性能的扩展定律

Berivan Isik, Natalia Ponomareva, Hussein Hazimeh, Dimitris Paparas, Sergei Vassilvitskii, Sanmi Koyejo

机构 * Google Research(谷歌研究) OpenAI(开放人工智能) Stanford University(斯坦福大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究探讨了预训练数据规模和分布对齐对大语言模型下游任务性能的影响,揭示了扩展定律在迁移学习中的应用及翻译质量的预测方法。

Comments Published at the International Conference on Learning Representations (ICLR) 2025, with title: "Scaling Laws for Downstream Task Performance in Machine Translation"

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22055 2026-01-30 cs.CL 57%

$G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA

$G^2$-Reader: 双重演化图式用于多模态文档问答

Yaxin Du, Junru Song, Yifan Zhou, Cheng Wang, Jiahao Gu, Zimeng Chen, Menglan Chen, Wen Yao, Yang Yang, Ying Wen, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Intelligent Game and Decision Laboratory(智能游戏与决策实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 $G^2$-Reader通过双重图式解决多模态文档问答中的结构破坏和检索失效问题,实现66.21%的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22047 2026-01-30 cs.CL 57%

On the Paradoxical Interference between Instruction-Following and Task Solving

关于指令遵循与任务解决之间的悖论性干扰

Yunjia Qi, Hao Peng, Xintong Shi, Amy Xin, Xiaozhi Wang, Bin Xu, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, BNRist(计算机科学与技术系,BNRist)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文揭示指令遵循可能干扰LLMs任务解决能力,并提出SUSTAINSCORE指标量化此干扰,通过实验表明添加自我显而易见约束会导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21768 2026-01-30 cs.CL 57%

Zonkey: A Hierarchical Diffusion Language Model with Differentiable Tokenization and Probabilistic Attention

Zonkey:一种具有可微分分词和概率注意力的分层扩散语言模型

Alon Rozental

机构 * Alon Rozental(独立研究者)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 Zonkey是一种通过可微分分词和概率注意力机制实现的分层扩散语言模型,能够从噪声中生成连贯文本并提升领域适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11479 2026-01-30 cs.AI 57%

Health Facility Location in Ethiopia: Leveraging LLMs to Integrate Expert Knowledge into Algorithmic Planning

埃塞俄比亚卫生设施选址:利用大语言模型整合专家知识到算法规划中

Yohai Trabelsi, Guojun Xiong, Fentabil Getnet, Stéphane Verguet, Milind Tambe

机构 * John A. Paulson School of Engineering and Applied Sciences, Harvard University(工程与应用科学学院,哈佛大学) National Data Management and Analytics Center for Health, Ethiopian Public Health Institute(健康数据管理与分析中心,埃塞俄比亚公共卫生研究所) Department of Global Health and Population, Harvard T.H. Chan School of Public Health(全球卫生与人口学院,哈佛T.H. Chan公共卫生学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种结合大语言模型和优化技术的混合框架,用于埃塞俄比亚卫生设施选址,以整合专家知识并提升规划的公平性和数据驱动性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21681 2026-01-30 cs.LG physics.flu-dyn 57%

LLM4Fluid: Large Language Models as Generalizable Neural Solvers for Fluid Dynamics

LLM4Fluid: 大语言模型作为通用神经求解器用于流体动力学

Qisong Xiao, Xinhai Chen, Qinglin Wang, Xiaowei Guo, Binglin Wang, Weifeng Chen, Zhichao Wang, Yunfei Liu, Rui Xia, Hang Zou, Gencheng Liu, Shuai Li, Jie Liu

机构 * National Key Laboratory of Parallel and Distributed Computing(平行与分布式计算国家重点实验室) Laboratory of Digitizing Software for Frontier Equipment(前沿设备数字化软件实验室) College of Computer Science and Technology(计算机科学与技术学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 LLM4Fluid利用大语言模型作为通用神经求解器,通过降阶建模和物理引导解构机制,实现流体动力学的高效预测与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22158 2026-01-30 cs.CL 57%

Context Parametrization with Compositional Adapters

基于组合适配器的上下文参数化

Josip Jukić, Martin Tutek, Jan Šnajder

机构 * TakeLab, University of Zagreb, Croatia(Take实验室,扎格雷布大学,克罗地亚)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 CompAs通过组合结构的适配器参数,提升LLM在长上下文和多任务中的效率与稳定性,提供一种更高效的部署方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24386 2026-01-30 cs.CV 50%

PCICF: A Pedestrian Crossing Identification and Classification Framework

PCICF:一种行人穿越识别与分类框架

Junyi Gu, Beatriz Cabrero-Daniel, Ali Nouri, Lydia Armini, Christian Berger

机构 * Chalmers University of Technology(楚德斯技术大学) University of Gothenburg(戈尔达堡大学) Volvo Cars(沃尔沃汽车公司)

专题命中 其他安全 :safety(abstract)

AI总结 PCICF提出了一种基于空间填充曲线的行人穿越识别与分类框架,利用合成数据集和真实世界数据集进行系统性训练和评估,以支持运营设计领域事件分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21508 2026-01-30 q-bio.NC 50%

How 'Neural' is a Neural Foundation Model?

神经基础模型的'神经'程度如何?

Johannes Bertram, Luciano Dyballa, Anderson Keller, Savik Kinger, Steven W. Zucker

专题命中 其他安全 :alignment(abstract)

AI总结 研究通过分析神经基础模型中神经元的时序响应模式,揭示了模型不同处理阶段的表征结构差异,并提出改进设计以更贴近生物系统。

Comments 28 pages, 18 figures, sumbitted to ICML 2026. arXiv admin note: substantial text overlap with arXiv:2512.07869

详情

展开后加载摘要…

URL PDF HTML 收藏