arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-30 至 2026-01-30 共收录 13 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 13 篇

2411.07042 2026-01-30 cs.HC cs.AI cs.CL cs.CY 67%

Minion: A Technology Probe to Explore How Users Negotiate Harmful Value Conflicts with AI Companions

Minion:一种技术探测器,用于探索用户如何与AI伙伴协商有害的价值冲突

Xianzhe Fan, Qing Xiao, Xuhui Zhou, Yuran Su, Zhicong Lu, Maarten Sap, Hong Shen

机构 * The University of Hong Kong(香港大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) Tsinghua University(清华大学) Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 Minion通过探测用户与AI伙伴协商有害价值冲突的过程,揭示了设计中需平衡用户责任与AI安全的挑战。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22009 2026-01-30 cond-mat.mtrl-sci cs.AI cs.LG physics.comp-ph 62%

MEIDNet: Multimodal generative AI framework for inverse materials design

MEIDNet: 多模态生成式AI框架用于反向材料设计

Anand Babu, Rogério Almeida Gouvêa, Pierre Vandergheynst, Gian-Marco Rignanese

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 MEIDNet通过多模态生成式AI框架实现反向材料设计,利用对比学习提升学习效率,生成低带隙钙钛矿结构并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23471 2026-01-30 cs.CL cs.AI 62%

Discovering Multi-Scale Semantic Structure in Text Corpora Using Density-Based Trees and LLM Embeddings

利用基于密度的树和大语言模型嵌入发现文本语料库的多尺度语义结构

Thomas Haschka, Joseph Bakarji

机构 * E020-04 Service Unit of High Performance Computing, DataLab, Campus IT, Technische Universität Wien(技术大学维也纳高性能计算服务单元,数据实验室,校园IT) Department of Mechanical Engineering, American University of Beirut(贝鲁特美国大学机械工程系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于密度的树和大语言模型嵌入的方法,用于发现文本语料库的多尺度语义结构,通过层次密度建模揭示主题之间的结构关系。

Comments 23 pages, 10 figures, further interactive visualizations available on https:// genealogy.sematlas.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17866 2026-01-30 cs.LG cs.AI 62%

Understanding Post-Training Structural Changes in Large Language Models

理解大型语言模型的训练后结构变化

Xinyu He, Xianghui Cao

机构 * School of Automation, Southeast University, Nanjing, China(自动化学院,东南大学,南京,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过SVD分析揭示了大型语言模型训练后参数空间的结构变化,发现奇异值缩放和奇异向量旋转机制,为理解训练后调节机制提供了新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04177 2026-01-30 cs.CL cs.LG stat.ML 62%

Scaling Laws for Downstream Task Performance of Large Language Models

大语言模型下游任务性能的扩展定律

Berivan Isik, Natalia Ponomareva, Hussein Hazimeh, Dimitris Paparas, Sergei Vassilvitskii, Sanmi Koyejo

机构 * Google Research(谷歌研究) OpenAI(开放人工智能) Stanford University(斯坦福大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究探讨了预训练数据规模和分布对齐对大语言模型下游任务性能的影响,揭示了扩展定律在迁移学习中的应用及翻译质量的预测方法。

Comments Published at the International Conference on Learning Representations (ICLR) 2025, with title: "Scaling Laws for Downstream Task Performance in Machine Translation"

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22055 2026-01-30 cs.CL 57%

$G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA

$G^2$-Reader: 双重演化图式用于多模态文档问答

Yaxin Du, Junru Song, Yifan Zhou, Cheng Wang, Jiahao Gu, Zimeng Chen, Menglan Chen, Wen Yao, Yang Yang, Ying Wen, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Intelligent Game and Decision Laboratory(智能游戏与决策实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 $G^2$-Reader通过双重图式解决多模态文档问答中的结构破坏和检索失效问题,实现66.21%的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22047 2026-01-30 cs.CL 57%

On the Paradoxical Interference between Instruction-Following and Task Solving

关于指令遵循与任务解决之间的悖论性干扰

Yunjia Qi, Hao Peng, Xintong Shi, Amy Xin, Xiaozhi Wang, Bin Xu, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, BNRist(计算机科学与技术系,BNRist)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文揭示指令遵循可能干扰LLMs任务解决能力,并提出SUSTAINSCORE指标量化此干扰,通过实验表明添加自我显而易见约束会导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21768 2026-01-30 cs.CL 57%

Zonkey: A Hierarchical Diffusion Language Model with Differentiable Tokenization and Probabilistic Attention

Zonkey:一种具有可微分分词和概率注意力的分层扩散语言模型

Alon Rozental

机构 * Alon Rozental(独立研究者)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 Zonkey是一种通过可微分分词和概率注意力机制实现的分层扩散语言模型,能够从噪声中生成连贯文本并提升领域适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11479 2026-01-30 cs.AI 57%

Health Facility Location in Ethiopia: Leveraging LLMs to Integrate Expert Knowledge into Algorithmic Planning

埃塞俄比亚卫生设施选址:利用大语言模型整合专家知识到算法规划中

Yohai Trabelsi, Guojun Xiong, Fentabil Getnet, Stéphane Verguet, Milind Tambe

机构 * John A. Paulson School of Engineering and Applied Sciences, Harvard University(工程与应用科学学院,哈佛大学) National Data Management and Analytics Center for Health, Ethiopian Public Health Institute(健康数据管理与分析中心,埃塞俄比亚公共卫生研究所) Department of Global Health and Population, Harvard T.H. Chan School of Public Health(全球卫生与人口学院,哈佛T.H. Chan公共卫生学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种结合大语言模型和优化技术的混合框架,用于埃塞俄比亚卫生设施选址,以整合专家知识并提升规划的公平性和数据驱动性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21681 2026-01-30 cs.LG physics.flu-dyn 57%

LLM4Fluid: Large Language Models as Generalizable Neural Solvers for Fluid Dynamics

LLM4Fluid: 大语言模型作为通用神经求解器用于流体动力学

Qisong Xiao, Xinhai Chen, Qinglin Wang, Xiaowei Guo, Binglin Wang, Weifeng Chen, Zhichao Wang, Yunfei Liu, Rui Xia, Hang Zou, Gencheng Liu, Shuai Li, Jie Liu

机构 * National Key Laboratory of Parallel and Distributed Computing(平行与分布式计算国家重点实验室) Laboratory of Digitizing Software for Frontier Equipment(前沿设备数字化软件实验室) College of Computer Science and Technology(计算机科学与技术学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 LLM4Fluid利用大语言模型作为通用神经求解器,通过降阶建模和物理引导解构机制,实现流体动力学的高效预测与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22158 2026-01-30 cs.CL 57%

Context Parametrization with Compositional Adapters

基于组合适配器的上下文参数化

Josip Jukić, Martin Tutek, Jan Šnajder

机构 * TakeLab, University of Zagreb, Croatia(Take实验室,扎格雷布大学,克罗地亚)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 CompAs通过组合结构的适配器参数,提升LLM在长上下文和多任务中的效率与稳定性,提供一种更高效的部署方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24386 2026-01-30 cs.CV 50%

PCICF: A Pedestrian Crossing Identification and Classification Framework

PCICF:一种行人穿越识别与分类框架

Junyi Gu, Beatriz Cabrero-Daniel, Ali Nouri, Lydia Armini, Christian Berger

机构 * Chalmers University of Technology(楚德斯技术大学) University of Gothenburg(戈尔达堡大学) Volvo Cars(沃尔沃汽车公司)

专题命中 其他安全 :safety(abstract)

AI总结 PCICF提出了一种基于空间填充曲线的行人穿越识别与分类框架,利用合成数据集和真实世界数据集进行系统性训练和评估,以支持运营设计领域事件分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21508 2026-01-30 q-bio.NC 50%

How 'Neural' is a Neural Foundation Model?

神经基础模型的'神经'程度如何?

Johannes Bertram, Luciano Dyballa, Anderson Keller, Savik Kinger, Steven W. Zucker

专题命中 其他安全 :alignment(abstract)

AI总结 研究通过分析神经基础模型中神经元的时序响应模式,揭示了模型不同处理阶段的表征结构差异,并提出改进设计以更贴近生物系统。

Comments 28 pages, 18 figures, sumbitted to ICML 2026. arXiv admin note: substantial text overlap with arXiv:2512.07869

详情

展开后加载摘要…

URL PDF HTML 收藏