arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-07 至 2026-01-07 共收录 41 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2507.07723 2026-01-07 cs.AI cs.CL cs.LG 67%

Stable Preference Optimization: A Bilevel Approach to Catastrophic Preference Shift

稳定偏好优化:一种针对灾难性偏好转移的双层方法

Chengtao Jian, Kai Yang, Tianhao Gao, Wuguang Ni, Keying Yang, Bowen Xiao, Jiajun Liu, Ye Ouyang

机构 * Tongji University(同济大学) AsiaInfo Technologies(亚洲信息科技)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出稳定偏好优化框架,通过约束偏好学习在安全对齐区域,解决灾难性偏好转移问题,提升偏好学习方法的稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20059 2026-01-07 cs.CL 57%

Enhancing Reasoning Skills in Small Persian Medical Language Models Can Outperform Large-Scale Data Training

增强小规模波斯语医疗语言模型的推理能力可超越大规模数据训练

Mehrdad Ghassabi, Sadra Hakim, Hamidreza Baradaran Kashani, Pedram Rostami

机构 * Faculty of Computer Engineering University of Isfahan(计算机工程系 布鲁金斯大学) School of Computer Science University of Windsor(计算机科学学院 温莎大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 通过RLAIF和DPO方法,提升小规模波斯语医疗模型推理能力,使其在有限数据下超越大规模训练模型。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13102 2026-01-07 cs.AI 57%

Socratic Students: Teaching Language Models to Learn by Asking Questions

苏格拉底学生:教语言模型通过提问学习

Rajeev Bhatt Ambati, Tianyi Niu, Aashu Singh, Shlok Mishra, Snigdha Chaturvedi, Shashank Srivastava

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Meta

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 本文提出ODQS框架,通过任务结果训练语言模型提问技能,提升交互推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12063 2026-01-07 cs.AI 57%

TextBO: Bayesian Optimization in Language Space for Eval-Efficient Self-Improving AI

TextBO: 在语言空间中基于贝叶斯优化的评估高效自改进AI

Enoch Hyunwook Kang, Hema Yoganarasimhan

机构 * University of Washington(华盛顿大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 TextBO是一种在语言空间中基于贝叶斯优化的评估高效自改进AI算法,通过结合文本梯度与最佳N选择策略,实现高效自改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03250 2026-01-07 cs.CV 50%

A Versatile Multimodal Agent for Multimedia Content Generation

多功能多模态代理用于多媒体内容生成

Daoan Zhang, Wenlin Yao, Xiaoyang Wang, Yebowen Hu, Jiebo Luo, Dong Yu

机构 * University of Rochester(罗切斯特大学) Tencent AI Lab, Bellevue(腾讯AI实验室) University of Central Florida(中央佛罗里达大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出了一种多功能多模态代理,通过技能获取理论和两阶段相关策略,实现复杂多媒体内容生成任务的自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2601.03005 2026-01-07 cs.CR cs.AI 85%

JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification

JPU: 通过在线策略路径校正弥合对抗防御与遗忘

Xi Wang, Songlei Jian, Shasha Li, Xiaopeng Li, Zhaoye Li, Bin Ji, Baosheng Wang, Jie Yu

机构 * National University of Defense Technology(国防科技大学)

专题命中 安全训练 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 JPU通过动态挖掘在线策略对抗样本,校正动态对抗路径以提升模型对抗攻击的鲁棒性。

Comments 14 pages, 6 figures, under review;

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19001 2026-01-07 cs.AI cs.LG 62%

ORPR: An OR-Guided Pretrain-then-Reinforce Learning Model for Inventory Management

ORPR:一种基于OR的预训练后再强化学习模型用于库存管理

Lingjie Zhao, Xue Yu, Yongzhi Qi, Hao Hu, Jianshen Zhang, Yingzheng Ma, Shuyu Han, Wei Qi, Zuo-Jun Max Shen

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) Supply Chain Tech Team Y, JD.com(京东供应链技术团队) Faculty of Engineering and Faculty of Business and Economics, The University of Hong Kong(香港大学工程学院和商学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于OR的预训练后再强化学习模型,通过结合领域知识和结构化优化逻辑,提升库存管理的决策效率与成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02577 2026-01-07 cs.AI astro-ph.IM hep-ph 57%

Orchestral AI: A Framework for Agent Orchestration

Orchestral AI: 一个用于智能体协调的框架

Alexander Roman, Jacob Roman

机构 * Orchestral AI

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 Orchestral AI 提供了一个统一的Python框架,用于跨多个LLM供应商构建智能体,通过类型安全接口和自动工具模式生成,简化了工具调用和跨供应商集成。

Comments 17 pages, 3 figures. For more information visit https://orchestral-ai.com

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2503.04833 2026-01-07 cs.CV cs.AI cs.CL 81%

E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models

E$^2$AT: 通过动态联合优化实现多模态对抗防御

Liming Lu, Xiang Gu, Shuchao Pang, Siyuan Liang, Haotian Zhu, Xiyu Zeng, Xu Zheng, Yongbin Zhou

机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology, China(南京理工大学信息科学与工程学院) HKUST(GZ) and INSAIT, Sofia University St. Kliment Ohridski(香港科技大学(广州)及INSAIT,索菲亚大学圣克莱门特·奥赫里迪斯学院) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI

AI总结 E$^2$AT通过动态联合优化提升多模态大语言模型对对抗攻击的鲁棒性,实验显示其在文本和图像模态上性能优于现有方法34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02377 2026-01-07 cs.RO 67%

Trust in LLM-controlled Robotics: a Survey of Security Threats, Defenses and Challenges

对LLM控制的机器人信任:安全威胁、防御和挑战的综述

Xinyu Huang, Shyam Karthick V B, Taozhao Chen, Mitch Bryson, Thomas Chaffey, Huaming Chen, Kim-Kwang Raymond Choo, Ian R. Manchester

机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) Australian Centre for Robotics and School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney(悉尼大学机器人中心及航空航天、机械与机电工程学院) Department of Information Systems and Cybersecurity, University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系统与网络安全系) School of Engineering and Natural Sciences, University of Iceland(冰岛大学工程与自然科学学院)

专题命中 越狱攻击 :safety(abstract);prompt injection(abstract)

AI总结 本文综述了LLM控制机器人面临的安全威胁和防御策略,强调了具身系统中恶意输出的物理风险,并提出了安全规范和多LLM监督等防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02680 2026-01-07 cs.CR cs.LG 57%

Adversarial Contrastive Learning for LLM Quantization Attacks

对抗对比学习用于大语言模型量化攻击

Dinghong Song, Zhiwei Xu, Hai Wan, Xibin Zhao, Pengfei Su, Dong Li

机构 * Tsinghua University(清华大学) University of California, Merced(加州大学默塞德分校)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

AI总结 本文提出对抗对比学习方法,通过最大化良性与有害响应概率差距,有效提升大语言模型量化攻击的成功率。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 2 篇

2512.10675 2026-01-07 cs.RO cs.AI cs.CV cs.LG 73%

Evaluating Gemini Robotics Policies in a Veo World Simulator

在Veo世界模拟器中评估Gemini机器人策略

Gemini Robotics Team, Krzysztof Choromanski, Coline Devin, Yilun Du, Debidatta Dwibedi, Ruiqi Gao, Abhishek Jindal, Thomas Kipf, Sean Kirmani, Isabel Leal, Fangchen Liu, Anirudha Majumdar, Andrew Marmon, Carolina Parada, Yulia Rubanova, Dhruv Shah, Vikas Sindhwani, Jie Tan, Fei Xia, Ted Xiao, Sherry Yang, Wenhao Yu, Allan Zhou

机构 * Gemini Robotics Team(Gemini机器人团队) Google DeepMind(谷歌DeepMind)

专题命中 红队测试 :safety(abstract);red teaming(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于Veo视频模型的生成式评估系统,用于在Veo世界模拟器中全面评估Gemini机器人策略的性能,包括名义性能、分布外泛化及安全约束测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00042 2026-01-07 cs.CR cs.AI cs.LG 62%

Large Empirical Case Study: Go-Explore adapted for AI Red Team Testing

大规模实证研究:为AI红队测试适应的Go-Explore

Manish Bhatt, Adrian Wood, Idan Habler, Ammar Al-Kahfah

机构 * Amazon(亚马逊公司) Dropbox(Dropbox公司) Cisco(思科公司)

专题命中 红队测试 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究通过Go-Explore评估GPT-4o-mini的安全性,发现种子方差和领域知识对测试结果影响显著,单种子比较不可靠,多种子平均能降低方差,奖励塑造导致探索崩溃和假阳性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2512.10449 2026-01-07 cs.AI cs.CL cs.CR 81%

When Reject Turns into Accept: Quantifying the Vulnerability of LLM-Based Scientific Reviewers to Indirect Prompt Injection

当拒绝转为接受:量化基于LLM的科学评审员对间接提示注入的脆弱性

Devanshu Sahoo, Manish Prasad, Vasudev Majhi, Jahnvi Singh, Vinay Chamola, Yash Sinha, Murari Mandal, Dhruv Kumar

机构 * BITS Pilani KIIT University(KIIT大学)

专题命中 提示注入 :prompt injection(title);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本研究量化了基于LLM的科学评审系统对间接提示注入攻击的脆弱性,揭示了通过隐藏文本注入和布局感知攻击翻转评审决定的风险,并提出WAVS指标评估此类攻击的严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06311 2026-01-07 cs.CR cs.AI 79%

Defending against Indirect Prompt Injection by Instruction Detection

对抗间接提示注入的指令检测

Tongyu Wen, Chenglong Wang, Xiyuan Yang, Haoyu Tang, Yueqi Xie, Lingjuan Lyu, Zhicheng Dou, Fangzhao Wu

机构 * Renmin University of China(中国人民大学) Peking University Shenzhen Graduate School(北京大学深圳研究生院) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Hong Kong University of Science and Technology(香港科技大学) Sony AI(索尼人工智能) Microsoft Research Asia(微软亚洲研究院)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出InstructDetector,通过检测LLMs行为状态来识别IPI攻击,实现高检测准确率和低攻击成功率。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 5 篇

2601.01887 2026-01-07 cs.LG cs.AI 84%

Safety at One Shot: Patching Fine-Tuned LLMs with A Single Instance

单次实例实现安全:用一个实例修补微调的LLM

Jiawen Zhang, Lipeng He, Kejia Chen, Jian Lou, Jian Liu, Xiaohu Yang, Ruoxi Jia

专题命中 幻觉与事实性 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 通过单个安全示例高效修复微调后的LLM安全性,无需牺牲实用性且成本极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17254 2026-01-07 cs.CV cs.AI 79%

Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats

干预所有路径:统一缓解跨对齐格式的大型视觉-语言模型幻觉

Jiaye Qian, Ge Zheng, Yuchen Zhu, Sibei Yang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ShanghaiTech University(上海科技大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出一种统一干预框架,通过分析不同路径间的相互作用,有效缓解跨对齐格式的LVLM幻觉问题。

Comments Accepted to NeurIPS 2025, Project Page: https://github.com/SooLab/AllPath

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02562 2026-01-07 cs.LG eess.IV 57%

CutisAI: Deep Learning Framework for Automated Dermatology and Cancer Screening

CutisAI: 用于自动化皮肤科和癌症筛查的深度学习框架

Rohit Kaushik, Eva Kaushik

机构 * Hanson Professional Services USA(Hanson专业服务公司) University of Tennessee Knoxville(田纳西大学肯纳邦克分校) Oak Ridge National Laboratory USA(橡树岭国家实验室)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 CBDC框架结合统计学习理论、拓扑数据分析和贝叶斯符合推断,实现了皮肤病和癌症筛查的高准确率和可信不确定性量化。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02766 2026-01-07 cs.RO cs.AR 50%

Advancing Assistive Robotics: Multi-Modal Navigation and Biophysical Monitoring for Next-Generation Wheelchairs

推动辅助机器人:多模态导航与生物物理监测用于下一代轮椅

Md. Anowar Hossain, Mohd. Ehsanul Hoque

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出了一种多模态轮椅控制系统,结合多种输入接口与生物物理监测,提升患者独立性并实现护理人员实时监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06472 2026-01-07 cs.CV cs.MM 50%

CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model

CalliReader:通过嵌入对齐的视觉-语言模型 contextualizing 中文书法

Yuxuan Luo, Jiaqi Tang, Chenyi Huang, Feiyang Hao, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 CalliReader通过字符级切片、视觉-文本对齐和嵌入指令微调,解决中文书法的上下文识别问题,实现比现有方法和专业书法家更高的准确性与更低的幻觉率。

Comments 11 pages

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 隐私与版权 1 篇

2601.02671 2026-01-07 cs.CL cs.AI cs.LG 75%

Extracting books from production language models

从生产语言模型中提取书籍

Ahmed Ahmed, A. Feder Cooper, Sanmi Koyejo, Percy Liang

机构 * Stanford University(斯坦福大学) Yale University(耶鲁大学)

专题命中 隐私与版权 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过两阶段方法测试从生产LLM中提取书籍的可行性,发现部分模型可提取受版权保护文本,但需不同劫持策略,揭示生产LLM存在训练数据泄露风险。

Comments We ran experiments from mid-August to mid-September 2025, notified affected providers shortly after, and now make our findings public after a 90-day disclosure window

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 安全评测 11 篇

2601.02364 2026-01-07 cs.IR cs.AI 74%

Towards Trustworthy LLM-Based Recommendation via Rationale Integration

通过推理整合实现可信的基于大语言模型的推荐

Chung Park, Taesan Kim, Hyeongjun Yun, Dongjoon Hong, Junui Hong, Kijung Park, MinCheol Cho, Mira Myong, Jihoon Oh, Min sung Choi

机构 * SK Telecom(SK电信)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文提出基于大语言模型的推荐系统,通过生成逻辑严谨的理由提升推荐的可解释性和性能。

Comments Accepted at RS4SD'25 (CIKM'25 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02669 2026-01-07 cs.CL 70%

Towards Comprehensive Stage-wise Benchmarking of Large Language Models in Fact-Checking

面向大规模语言模型事实核查的全面阶段性基准评估

Hongzhan Lin, Zixin Chen, Zhiqi Shen, Ziyang Luo, Zhen Ye, Jing Ma, Tat-Seng Chua, Guandong Xu

机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Salesforce AI Research(Salesforce AI 研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) The Education University of Hong Kong(香港教育大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 FactArena提出一个全面的LLM事实核查阶段基准评估框架,通过标准化流程和动态生成挑战性声明,揭示LLM在事实推理中的鲁棒性与准确性差异。

Comments 17 pages, 21 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03750 2026-01-07 cs.LG cs.AI cs.CL cs.CY 70%

The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems

MASK基准:在人工智能系统中区分诚实与准确性

Richard Ren, Arunim Agarwal, Mantas Mazeika, Cristina Menghini, Robert Vacareanu, Brad Kenstler, Mick Yang, Isabelle Barrass, Alice Gatti, Xuwang Yin, Eduardo Trevino, Matias Geralnik, Adam Khoja, Dean Lee, Summer Yue, Dan Hendrycks

机构 * Center for AI Safety(人工智能安全中心) Scale AI

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出MASK基准,通过大规模人工数据集区分LLM的准确性和诚实性,发现大模型虽更准确但不更诚实,简单干预可提升诚实度,强调需加强评估与干预以确保模型可信。

Comments Website: https://www.mask-benchmark.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03025 2026-01-07 cs.IR cs.AI cs.CL cs.LG 67%

LORE: A Large Generative Model for Search Relevance

LORE:一种大规模生成模型用于搜索相关性

Chenji Lu, Zhuo Chen, Hui Zhao, Zhiyuan Zeng, Gang Zhao, Junjie Ren, Ruicong Xu, Haoran Li, Songyan Liu, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LORE提出了一种基于大规模生成模型的搜索相关性框架,通过两阶段训练和分层部署策略提升搜索效果,为垂直领域提供方法参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21813 2026-01-07 cs.AI cs.CL cs.IR cs.LG 67%

OAEI-LLM-T: A TBox Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching

OAEI-LLM-T:用于理解大规模语言模型幻觉的本体匹配TBox基准数据集

Zhangcheng Qiang, Kerry Taylor, Weiqing Wang, Jing Jiang

机构 * Australian National University(澳大利亚国立大学) Monash University(墨尔本大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OAEI-LLM-T是一个用于研究大规模语言模型在本体匹配中幻觉问题的TBox基准数据集,通过分类幻觉类型并提供评估工具,促进对LLM在OM任务中表现的深入理解。

Comments 14 pages, 4 figures, 4 tables, 2 prompt templates

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03227 2026-01-07 cs.SD cs.AI 57%

The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization

声纳时刻:在音频地理定位中基准测试音频语言模型

Ruixing Zhang, Zihan Liu, Leilei Sun, Tongyu Zhu, Weifeng Lv

机构 * The State Key Laboratory of Complex and Critical Software Environment, Beihang University(复杂与关键软件环境国家重点实验室,北航) Shanghai AI Laboratory(上海人工智能实验室) The Key Laboratory of Data Science and Intelligent Computing, International Innovation Institute, Beihang University(数据科学与智能计算重点实验室,国际创新研究院,北航)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出AGL1K基准,用于评估音频语言模型在音频地理定位中的能力,发现封闭源模型表现更优,语言线索在预测中起主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03120 2026-01-07 cs.AI 57%

A framework for assuring the accuracy and fidelity of an AI-enabled Digital Twin of en route UK airspace

一种确保基于AI的英国空域数字孪生准确性和保真的框架

Adam Keane, Nick Pepper, Chris Burr, Amy Hodgkin, Dewi Gould, John Korna, Marc Thomas

机构 * The Alan Turing Institute(阿尔法·图灵研究院) NATS(国家空中交通服务) Queen Mary University London(伦敦女王学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的数字孪生准确性和保真度保证框架,结合可信和伦理保证方法,为研究人员和监管机构提供评估和讨论数字孪生的结构化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09146 2026-01-07 cs.CL 57%

DoPE: Denoising Rotary Position Embedding

DoPE: 去噪旋转位置嵌入

Jing Xiong, Liyang Fan, Hui Shen, Zunhai Su, Min Yang, Lingpeng Kong, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of Michigan, Ann Arbor(密歇根大学安阿伯分校) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 DoPE通过去噪旋转位置嵌入提升大型语言模型在长上下文外推和鲁棒性方面的性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02814 2026-01-07 cs.AI 57%

Causal-Enhanced AI Agents for Medical Research Screening

因果增强的医疗研究筛查AI代理

Duc Ngo, Arya Rahgoza

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种因果图增强的AI代理,用于医疗研究筛选,通过显式因果推理和双层知识图谱提升系统综述的准确性和可解释性。

Comments for submission to The 39th Canadian Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏