arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-23 至 2025-12-23 共收录 63 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 63 篇

2511.02376 2025-12-23 cs.CL cs.AI cs.CR cs.LG 91%

AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models

AutoAdv:面向大语言模型多轮对抗性提示的自动化 jailbreaking

Aashray Reddy, Andrew Zagula, Nicholas Saban

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL、cs.AI、cs.LG

AI总结 AutoAdv通过多轮自适应机制实现高成功率的对抗性提示攻击,揭示当前安全机制在多轮对话中的脆弱性。

Comments Presented at NeurIPS 2025 Lock-LLM Workshop. Code is available at https://github.com/AAN-AutoAdv/AutoAdv

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18622 2025-12-23 cs.DB cs.AI cs.CL cs.HC cs.MA 90%

A Multi-agent Text2SQL Framework using Small Language Models and Execution Feedback

基于小型语言模型和执行反馈的多智能体文本到SQL框架

Thanh Dat Hoang, Thanh Trung Huynh, Matthias Weidlich, Thanh Tam Nguyen, Tong Chen, Hongzhi Yin, Quoc Viet Hung Nguyen

机构 * Griffith University (Australia)(格里菲斯大学) VinUniversity (Vietnam)(文大学) Humboldt-Universitat zu Berlin (Germany)(柏林洪堡大学) The University of Queensland, Australia (2025)(昆士兰大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title);LLM(abstract);large language model(abstract)

AI总结 MATS是一种针对小型语言模型的文本到SQL框架,通过多智能体机制和强化学习训练方案,在有限参数下实现与大规模LLM相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12399 2025-12-23 cs.AI 89%

A Survey of Vibe Coding with Large Language Models

基于大语言模型的Vibe编码调研

Yuyao Ge, Lingrui Mei, Zenghao Duan, Tianhao Li, Yujia Zheng, Yiwei Wang, Lexin Wang, Jiayu Yao, Tianyu Liu, Yujun Cai, Baolong Bi, Fangda Guo, Jiafeng Guo, Shenghua Liu, Xueqi Cheng

机构 * Institute of Computing Technology Chinese Academy of Sciences(中国科学院计算技术研究所) Duke University(杜克大学) University of California Merced(加州大学默塞德分校) Peking University(北京大学) University of Queensland(昆士兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文调研了基于大语言模型的Vibe编码方法,系统分析了其理论基础和五个开发模型,揭示了上下文工程与协作模式对成功的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09337 2025-12-23 cs.CL 89%

Decoding Neural Emotion Patterns through Large Language Model Embeddings

通过大型语言模型嵌入解码神经情绪模式

Gideon Vos, Maryam Ebrahimpour, Liza van Eijk, Zoltan Sarnyai, Mostafa Rahimi Azghadi

机构 * College of Science and Engineering, James Cook University(科学与工程学院,詹姆斯库克大学) College of Health Care Sciences, James Cook University(健康护理科学学院,詹姆斯库克大学) College of Public Health, Medical, and Vet Sciences, James Cook University(公共健康、医学与兽医学学院,詹姆斯库克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 通过大型语言模型嵌入解码神经情绪模式,实现情绪与大脑区域的映射,区分抑郁人群与基本情绪分布,提供AI情感表达的脑基准评估。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02800 2025-12-23 cs.CL 89%

Survey and Experiments on Mental Disorder Detection via Social Media: From Large Language Models and RAG to Agents

面向社交媒体的抑郁症检测综述与实验:从大型语言模型和RAG到代理

Zhuohan Ge, Darian Li, Yubo Wang, Nicole Hu, Xinyi Zhu, Haoyang Li, Xin Zhang, Mingtao Zhang, Shihao Qi, Yuming Xu, Han Shi, Chen Jason Zhang, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文综述并实验了基于社交媒体的抑郁症检测方法,探讨了LLM、RAG和代理系统在提升检测可靠性与推理能力中的应用。

Comments 20 pages, 10 figures. This is an extension of ICDEW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19114 2025-12-23 cs.LG cs.AI 88%

HyperLoad: A Cross-Modality Enhanced Large Language Model-Based Framework for Green Data Center Cooling Load Prediction

HyperLoad: 一种基于大语言模型的跨模态增强框架用于绿色数据中心冷却负荷预测

Haoyu Jiang, Boan Qu, Junjie Zhu, Fanjie Zeng, Xiaojie Lin, Wei Zhong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 HyperLoad通过预训练大语言模型解决绿色数据中心小样本负载预测问题,利用跨模态知识对齐和多尺度特征建模提升预测精度,实现高效能绿色数据中心管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17992 2025-12-23 cs.RO 88%

Unifying Deep Predicate Invention with Pre-trained Foundation Models

统一深度谓词发明与预训练基础模型

Qianwei Wang, Bowen Li, Zhanpeng Luo, Yifan Xu, Alexander Gray, Tom Silver, Sebastian Scherer, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Computer Science and Engineering Division, University of Michigan(密歇根大学计算机科学与工程系) Department of Computer Science, University of Pittsburgh(匹兹堡大学计算机科学系) Centaur AI Institute(Centaur人工智能研究所) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 UniPred通过双层学习框架统一深度谓词发明与预训练基础模型,提升机器人任务的可扩展性和灵活性。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19350 2025-12-23 cs.AI 88%

PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models

PENDULUM: 一个用于评估多模态大语言模型顺从性的基准

A. B. M. Ashikur Rahman, Saeed Anwar, Muhammad Usman, Irfan Ahmad, Ajmal Mian

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 PENDULUM基准通过2000个视觉问答对评估多模态大语言模型的顺从性,揭示模型在顺从性和幻觉行为上的显著差异,提出新度量标准以提升模型的事实一致性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18244 2025-12-23 cs.CR cs.AI 88%

Breaking Minds, Breaking Systems: Jailbreaking Large Language Models via Human-like Psychological Manipulation

打破思维,打破系统:通过类人心理操纵进行大语言模型的劫持攻击

Zehao Liu, Xi Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出类人心理操纵方法,通过操纵大语言模型的心理状态实现高成功率的劫持攻击,验证了心理安全机制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19238 2025-12-23 cs.CL cs.AI cs.LG 87%

Identifying Features Associated with Bias Against 93 Stigmatized Groups in Language Models and Guardrail Model Safety Mitigation

识别与偏见相关的93个被污名化的群体特征及语言模型的安全防护措施

Anna-Maria Gueorguieva, Aylin Caliskan

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了语言模型对93个污名化群体的偏见来源,并测试了防护模型对减少偏见的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17638 2025-12-23 cs.AI cs.CL cs.LG 87%

LLM-as-a-Prophet: Understanding Predictive Intelligence with Prophet Arena

LLM-as-a-Prophet: 通过Prophet Arena理解预测智能

Qingchuan Yang, Simon Mahns, Sida Li, Anri Gu, Jibang Wu, Haifeng Xu

机构 * University of Southern California(南加州大学) Meta The University of Chicago(芝加哥大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过Prophet Arena评估了LLMs在预测任务中的表现,揭示了其预测能力及存在的瓶颈。

Comments https://www.prophetarena.co/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19349 2025-12-23 cs.AI cs.LG 86%

VIGOR+: Iterative Confounder Generation and Validation via LLM-CEVAE Feedback Loop

VIGOR+: 通过LLM-CEVAE反馈循环实现迭代混杂因素生成与验证

JiaWei Zhu, ZiHeng Liu

机构 * Guangdong University of Technology(广东工业大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VIGOR+通过LLM与CEVAE的反馈循环实现迭代混杂因素生成与验证,提升因果推断的统计效用。

Comments 7 pages,1 figure,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18940 2025-12-23 cs.CL cs.SE 85%

FASTRIC: Prompt Specification Language for Verifiable LLM Interactions

FASTRIC:用于可验证大语言模型交互的提示规范语言

Wen-Long Jin

机构 * Department of Civil and Environmental Engineering(土木与环境工程系) California Institute for Telecommunications and Information Technology(电信与信息科技学院) Institute of Transportation Studies(交通研究学院) University of California, Irvine, CA 92697-3600(加州大学伊维德分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FASTRIC通过显式化有限状态机构建可验证的大语言模型交互协议,揭示模型特定的规范正式程度范围,实现交互设计的系统化工程。

Comments 13 pages, 3 figures. Supplementary materials at https://doi.org/10.17605/OSF.IO/PV6R3

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18755 2025-12-23 cs.AI 85%

MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking

MEEA: 基于mere exposure效应的对抗性优化用于LLM jailbreaking

Jianyi Zhang, Shizhao Liu, Ziyin Zhou, Zhen Li

机构 * Beijing Electronic Science and Technology Institute(北京电子科技研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MEEA通过基于mere exposure效应的对抗性优化,提升LLM jailbreaking的攻击成功率,揭示LLM安全行为的动态性和历史依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18035 2025-12-23 cs.LG cs.CR 84%

Towards Benchmarking Privacy Vulnerabilities in Selective Forgetting with Large Language Models

面向大语言模型中选择性遗忘隐私漏洞的基准测试

Wei Qian, Chenxu Zhao, Yangyi Li, Mengdi Huai

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.LG

AI总结 本文提出首个评估选择性遗忘隐私漏洞的基准,系统研究了反向学习技术的隐私漏洞,并为定制应用提供标准化工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01382 2025-12-23 cs.SE cs.AI cs.LG 84%

Automatic Detection of LLM-Generated Code: A Comparative Case Study of Contemporary Models Across Function and Class Granularities

大语言模型生成代码的自动检测:对当代模型在函数和类粒度上的比较案例研究

Musfiqur Rahman, SayedHassan Khatoonabadi, Ahmad Abdellatif, Emad Shihab

机构 * Concordia University(康科迪亚大学) University of Calgary(卡尔加里大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过比较四个大语言模型在函数和类粒度上的代码生成能力,发现粒度效应主导模型差异,且不同模型在不同粒度上的检测性能存在显著差异。

Comments Submitted to a journal for potential publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17196 2025-12-23 cs.LG 83%

Shape it Up! Restoring LLM Safety during Finetuning

Shape it Up! 修复微调过程中LLM的安全性

ShengYun Peng, Pin-Yu Chen, Jianfeng Chi, Seongmin Lee, Duen Horng Chau

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 动态安全塑造(DSS)通过细粒度安全信号在微调过程中动态增强安全内容,有效缓解安全风险,提升模型安全性。

Comments NeurIPS'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17920 2025-12-23 cs.CL cs.AI 82%

Separating Constraint Compliance from Semantic Accuracy: A Novel Benchmark for Evaluating Instruction-Following Under Compression

分离约束合规性与语义准确性:一种新的基准,用于在压缩下评估指令遵循

Rahul Baxi

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出CDCT基准,揭示LLMs在压缩下约束合规性与语义准确性之间的矛盾,发现中等压缩时约束违规主要由RLHF训练的有用性行为导致。

Comments 19 pages, 9 figures; currently under peer review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18462 2025-12-23 cs.CL cs.AI cs.LG 82%

Mitigating Spurious Correlations in NLI via LLM-Synthesized Counterfactuals and Dynamic Balanced Sampling

通过LLM合成的反事实和动态平衡采样缓解NLI中的虚假相关性

Christopher Román Jaimes

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种自动化流程,通过LLM合成反事实和动态平衡采样缓解NLI中的虚假相关性,提升了模型性能和领域内准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18745 2025-12-23 cs.CV cs.CL cs.LG 81%

InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search

InSight-o3: 通过通用视觉搜索增强多模态基础模型

Kaican Li, Lewei Yao, Jiannan Wu, Tiezheng Yu, Jierun Chen, Haoli Bai, Lu Hou, Lanqing Hong, Wei Zhang, Nevin L. Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Huawei(华为)

专题命中 评测与基准 :foundation model(title);LLM(abstract);分类 cs.CL、cs.LG

AI总结 InSight-o3通过通用视觉搜索任务提升多模态基础模型的推理能力,解决复杂视觉信息整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19122 2025-12-23 cs.SE cs.CL 79%

BanglaForge: LLM Collaboration with Self-Refinement for Bangla Code Generation

BanglaForge: 通过自反思的LLM协作实现孟加拉语代码生成

Mahir Labib Dihan, Sadif Ahmed, Md Nafiu Rahman

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 BanglaForge通过双模型协作与自反思技术,实现低资源孟加拉语代码生成,达到84.00%的Pass@1准确率。

Comments Accepted at BLP Workshop @ IJCNLP-AACL 2025. Code is available at https://github.com/mahirlabibdihan/BanglaForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02366 2025-12-23 cs.CL 79%

LiveSecBench: A Dynamic and Event-Driven Safety Benchmark for Chinese Language Model Applications

LiveSecBench: 一种动态且事件驱动的安全基准,用于中文语言模型应用

Yudong Li, Peiru Yang, Feng Huang, Zhongliang Yang, Kecheng Wang, Haitian Li, Baocheng Chen, Xingyu An, Ziyu Liu, Youdan Yang, Kejiang Chen, Sifang Wan, Xu Wang, Yufei Sun, Liyan Wu, Ruiqi Zhou, Wenya Wen, Xingchi Gu, Tianxin Zhang, Yue Gao, Yongfeng Huang

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学) IntokenTech

专题命中 评测与基准 :language model(title);LLM(abstract);分类 cs.CL

AI总结 LiveSecBench通过动态更新和多维度评估,为中文大模型的安全性提供持续改进的标准和排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19210 2025-12-23 cs.AI 78%

Observer, Not Player: Simulating Theory of Mind in LLMs through Game Observation

观察者,而非玩家:通过游戏观察模拟大语言模型中的理论心理论

Jerry Wang, Ting Yiu Liu

机构 * Department of Management Information Systems, National ChengChi University(管理信息系,国立中正大学)

专题命中 评测与基准 :language model(abstract,comments);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 通过游戏观察模拟大语言模型中的理论心理论,评估其在顺序行为中的推理能力。

Comments Accepted at NeurIPS Workshop on Foundations of Reasoning in Language Models and Workshop on Bridging Language, Agent, and World Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18256 2025-12-23 cs.AI cs.LO 77%

MSC-180: A Benchmark for Automated Formal Theorem Proving from Mathematical Subject Classification

MSC-180:一个用于从数学学科分类自动形式定理证明的基准

Sirui Li, Wangyue Lu, Xiaorui Shi, Ke Weng, Haozhe Sun, Minghe Yu, Tiancheng Zhang, Ge Yu, Hengyu Liu, Lun Du

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MSC-180是一个用于评估自动形式定理证明的基准,揭示了当前基于LLM的定理证明者在数学领域覆盖和泛化能力上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18131 2025-12-23 cs.SE cs.AI 77%

Holistic Evaluation of State-of-the-Art LLMs for Code Generation

全方位评估最新大型语言模型在代码生成中的表现

Le Zhang, Suresh Kothari

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究评估了六个最新大型语言模型在代码生成中的表现,发现DeepSeek-R1和GPT-4.1在正确性、效率和鲁棒性方面表现最佳,强调了提示工程和人类监督的重要性。

Comments 13 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12422 2025-12-23 cs.CL 77%

FactEHR: A Dataset for Evaluating Factuality in Clinical Notes Using LLMs

FactEHR: 一个用于使用LLMs评估临床笔记事实性的数据集

Monica Munnangi, Akshay Swaminathan, Jason Alan Fries, Jenelle Jindal, Sanjana Narayanan, Ivan Lopez, Lucia Tu, Philip Chung, Jesutofunmi A. Omiye, Mehr Kashyap, Nigam Shah

机构 * Khoury College of Computer Sciences, Northeastern University(东北大学克劳尔计算机科学学院) Center for Biomedical Informatics Research, Stanford University(斯坦福大学生物医学信息学研究中心) Department of Biomedical Data Science, Stanford School of Medicine(斯坦福医学院生物医学数据科学系) Stanford Health Care(斯坦福健康系统) Department of Medicine, Stanford School of Medicine(斯坦福医学院医学系) Clinical Excellence Research Center, Stanford School of Medicine(斯坦福医学院临床卓越研究中心) Department of Anesthesiology, Perioperative & Pain Medicine, Stanford School of Medicine(斯坦福医学院麻醉学、手术及疼痛医学系) Department of Dermatology, Stanford School of Medicine(斯坦福医学院皮肤病学系) Technology and Digital Solutions, Stanford Health Care(斯坦福健康系统技术与数字解决方案)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FactEHR是一个用于评估LLMs在临床笔记中事实分解能力的数据集,通过生成987,266个蕴含对揭示LLM在细粒度事实验证中的性能差异。

Comments To appear at MLHC 2025

Journal ref Journal-ref: Proceedings of Machine Learning Research (PMLR), vol. 298, Proceedings of the Machine Learning for Healthcare Conference (MLHC), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19675 2025-12-23 econ.GN cs.CV cs.DL q-fin.EC 75%

Multimodal LLMs for Historical Dataset Construction from Archival Image Scans: German Patents (1877-1918)

多模态大语言模型用于从档案图像扫描中构建历史数据集:德国专利(1877-1918)

Niclas Griesshaber, Jochen Streb

机构 * University of Mannheim(曼海姆大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用多模态大语言模型构建德国1877-1918年专利数据集,证明其在效率和质量上的优势,并开源相关工具和数据以促进经济史研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18653 2025-12-23 cond-mat.mtrl-sci 75%

Tackling dataset curation challenges towards reliable machine learning: a case study on thermoelectric materials

应对数据集整理挑战以实现可靠的机器学习:热电材料的案例研究

Shoeb Athar, Adrien Mecibah, Philippe Jund

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于统计轮换误差的数据过滤方法,用于解决热电材料数据集中的不准确性和不一致性问题,并通过混合数据集创建流程提升数据质量。

Comments 10 pages, 9 figures

Journal ref Mater. Today Phys. 59, 101948 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19171 2025-12-23 cs.CR 75%

Can LLMs Threaten Human Survival? Benchmarking Potential Existential Threats from LLMs via Prefix Completion

大语言模型是否威胁人类生存?通过前缀完成评估大语言模型潜在的灭绝性威胁

Yu Cui, Yifei Liu, Hang Fu, Sicheng Pan, Haibin Zhang, Cong Zuo, Licheng Wang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出 ExistBench 基准,通过前缀完成评估 LLMs 的潜在灭绝性威胁,发现 LLMs 生成内容包含危害人类生存的输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18165 2025-12-23 q-bio.NC 75%

Coord2Region: A Python Package for Mapping 3D Brain Coordinates to Atlas Labels, Literature, and AI Summaries

Coord2Region: 一个用于将3D大脑坐标映射到图谱标签、文献和AI摘要的Python包

Hamza Abdelhedi, Yorguin-Jose Mantilla-Ramos, Sina Esmaeili, Annalisa Pascarella, Vanessa Hadid, Karim Jerbi

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Coord2Region是一个Python工具,通过自动映射3D大脑坐标到多个图谱标签、文献和AI摘要,提升神经影像学研究的效率和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏