arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-25 至 2025-11-25 共收录 126 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 32 篇

2511.17602 2025-11-25 cs.LG cs.AI 62%

Beyond Surface-Level Similarity: Hierarchical Contamination Detection for Synthetic Training Data in Foundation Models

超越表层相似性:面向基础模型合成训练数据的分层污染检测

Sushant Mehta

机构 * Sushant Mehta

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出分层污染检测框架,用于检测基础模型中合成训练数据的语义污染问题,提升评估准确性与数据可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07793 2025-11-25 cs.CL cs.AI 62%

LLM4Cell: A Survey of Large Language and Agentic Models for Single-Cell Biology

LLM4Cell: 一种用于单细胞生物学的大语言和代理模型综述

Sajib Acharjee Dip, Adrika Zafor, Bikash Kumar Paul, Uddip Acharjee Shuvo, Muhit Islam Emon, Xuan Wang, Liqing Zhang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) Department of Computational Modeling and Data Analytics, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算建模与数据分析系) Institute of Information and Technology, University of Dhaka, Dhaka, Bangladesh(达卡大学信息技术学院) Fralin Biomedical Research Institute at VTC: Cancer Research Center, Washington DC, USA(弗拉林生物医学研究中心:癌症研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LLM4Cell综述了58个用于单细胞生物学的大语言和代理模型,分析了其在注释、轨迹建模和药物反应预测等任务中的表现,并指出了可解释性、标准化和可信模型开发的挑战。

Comments 34 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19492 2025-11-25 cs.CL cs.AI 62%

MedHalu: Hallucinations in Responses to Healthcare Queries by Large Language Models

MedHalu:大型语言模型在医疗查询中生成幻觉的研究

Vibhor Agarwal, Yiqiao Jin, Mohit Chandra, Munmun De Choudhury, Srijan Kumar, Nishanth Sastry

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MedHalu研究了LLM在医疗查询中生成幻觉的问题,提出MedHalu基准和MedHaluDetect框架,发现LLM在检测医学幻觉方面表现不佳,提出专家在环方法提升检测效果。

Comments Accepted at ICWSM2026. https://netsys.surrey.ac.uk/datasets/medhalu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19427 2025-11-25 cs.SE cs.AI 57%

Prompt Less, Smile More: MTP with Semantic Engineering in Lieu of Prompt Engineering

无需提示,微笑更多:通过语义工程替代提示工程的MTP

Jayanaka L. Dantanarayana, Savini Kashmira, Thakee Nathees, Zichen Zhang, Krisztian Flautner, Lingjia Tang, Jason Mars

机构 * University of Michigan(密歇根大学) Jaseci Labs(Jaseci实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 通过语义工程替代提示工程,提升AI集成编程中提示的准确性与开发者效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18854 2025-11-25 cs.SE cs.AI 57%

Time Travel: LLM-Assisted Semantic Behavior Localization with Git Bisect

时间旅行:借助Git Bisect的LLM辅助语义行为定位

Yujing Wang, Weize Hong

机构 * University of Waterloo(滑铁卢大学) Brock University(布罗克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用LLM和Git Bisect进行语义行为定位,通过结构化推理链提升故障定位准确率,实验显示成功率提升6.4个百分点,平均bisect时间减少2倍。

Comments submitted to Git Bisect SCALCOM 2025 Calgary (to be published)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01285 2025-11-25 cs.AI cs.IR stat.AP 57%

BioDisco: Multi-agent hypothesis generation with dual-mode evidence, iterative feedback and temporal evaluation

BioDisco:基于双模式证据、迭代反馈和时间评估的多智能体假设生成

Yujing Ke, Kevin George, Kathan Pandya, David Blumenthal, Maximilian Sprang, Gerrit Großmann, Sebastian Vollmer, David Antony Selby

机构 * Data Science and its Applications, DFKI(数据科学及其应用,德系人工智能研究所) DFKI Friedrich-Alexander-Universität Erlangen-Nürnberg(德系人工智能研究所,弗赖堡-埃朗根-纽伦堡大学) University of Saarland(萨尔大学) Friedrich-Alexander-Universität Erlangen-Nürnberg(弗赖堡-埃朗根-纽伦堡大学) University of Kaiserslautern–Landau (RPTU)(凯撒斯劳滕-兰道大学(RPTU)) Department of Dermatology, University Medical Center Mainz(梅奥医学中心法兰克福大学皮肤科)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 BioDisco通过双模式证据系统、迭代反馈和时间评估,实现多智能体生成新颖且证据支持的科学假设。

Comments 12 pages main content, 31 including appendices. 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18436 2025-11-25 cs.CL 57%

Can Code-Switched Texts Activate a Knowledge Switch in LLMs? A Case Study on English-Korean Code-Switching

代码切换文本能否在LLMs中激活知识切换?一种英语-韩语代码切换案例研究

Seoyeon Kim, Huiseo Kim, Chanjun Park, Jinyoung Yeo, Dongha Lee

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过EnKoQA数据集探讨代码切换是否能激活LLMs中的知识,发现其在低资源语言任务中具有潜力。

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18486 2025-11-25 cs.CL 57%

Evaluation of OpenAI o1: Opportunities and Challenges of AGI

OpenAI o1的评估:通用人工智能的机会与挑战

Tianyang Zhong, Zhengliang Liu, Yi Pan, Yutong Zhang, Zeyu Zhang, Yifan Zhou, Shizhe Liang, Zihao Wu, Yanjun Lyu, Peng Shu, Xiaowei Yu, Chao Cao, Hanqi Jiang, Hanxu Chen, Yiwei Li, Junhao Chen, Huawen Hu, Yiheng Liu, Huaqin Zhao, Shaochen Xu, Haixing Dai, Lin Zhao, Ruidong Zhang, Wei Zhao, Zhenyuan Yang, Jingyuan Chen, Peilong Wang, Wei Ruan, Hui Wang, Huan Zhao, Jing Zhang, Yiming Ren, Shihuan Qin, Tong Chen, Jiaxi Li, Arif Hassan Zidan, Afrar Jahin, Minheng Chen, Sichen Xia, Jason Holmes, Yan Zhuang, Jiaqi Wang, Bochen Xu, Weiran Xia, Jichao Yu, Kaibo Tang, Yaxuan Yang, Bolun Sun, Tao Yang, Guoyu Lu, Xianqiao Wang, Lilong Chai, He Li, Jin Lu, Xin Zhang, Bao Ge, Xintao Hu, Lian Zhang, Hua Zhou, Lu Zhang, Shu Zhang, Zhen Xiang, Yudan Ren, Jun Liu, Xi Jiang, Yu Bao, Wei Zhang, Xiang Li, Gang Li, Wei Liu, Dinggang Shen, Andrea Sikora, Xiaoming Zhai, Dajiang Zhu, Tuo Zhang, Tianming Liu

机构 * Department of Mathematical and Statistical Sciences, University of Alberta, Edmonton, Canada(阿尔伯塔大学数学与统计学系) School of Computing, University of Georgia, GA, USA(佐治亚大学计算机科学学院) Institute of Medical Research, Northwestern Polytechnical University, Xi’an, China(西北工业大学医学研究所) Department of Computer Science and Engineering, University of Texas at Arlington, TX, USA(德克萨斯大学阿灵顿分校计算机科学与工程系) College of Arts and Sciences, University of Georgia, Athens, USA(佐治亚大学文理学院) Institute of Plant Breeding, Genetics & Genomics, University of Georgia, Athens, GA, USA(佐治亚大学植物育种、遗传与基因组研究所) School of Computer Science, Northwestern Polytechnical University, Xi’an, China(西北工业大学计算机科学学院) School of Automation, Northwestern Polytechnical University, Xi’an, China(西北工业大学自动化学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 OpenAI o1在多领域复杂推理任务中表现出色,展现出接近或超越人类水平的能力,为通用人工智能的发展提供了重要进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17624 2025-11-25 cs.LG 57%

QML-HCS: A Hypercausal Quantum Machine Learning Framework for Non-Stationary Environments

QML-HCS:一种用于非平稳环境的超因果量子机器学习框架

Hector E Mozo

机构 * NeureonMindFlux Research Lab(NeureonMindFlux研究实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 QML-HCS通过超因果反馈动态和混合执行机制,为非平稳环境中的量子启发式机器学习提供适应性框架。

Comments 11 pages, 10 figures, and 8 tables. The implementation and full source code of the Hypercausal Quantum Machine Learning System (QML-HCS) are openly available on GitHub at: https://github.com/Neureonmindflux-Research-Lab/qml-hcs

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19021 2025-11-25 cs.CV 50%

Dynamic Granularity Matters: Rethinking Vision Transformers Beyond Fixed Patch Splitting

动态粒度至关重要:超越固定补丁分割的视觉变换器重新思考

Qiyang Yu, Yu Fang, Tianrui Li, Xuemei Cao, Yan Chen, Jianghao Li, Fan Min

机构 * School of Computer Science and Software Engineering, Southwest Petroleum University(计算机科学与软件工程学院,西南石油大学) School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算与人工智能学院,西南交通大学) School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics(计算与人工智能学院,西南财经大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Grc-ViT,通过动态调整视觉粒度提升细粒度辨别能力,实现更高效的特征学习。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09938 2025-11-25 cs.HC 50%

Design and Evaluation of Generative Agent-based Platform for Human-Assistant Interaction Research: A Tale of 10 User Studies

生成性代理平台的设计与评估:人类-助手交互研究的叙述:10项用户研究

Ziyi Xuan, Yiwen Wu, Xuhai Xu, Vinod Namboodiri, Mooi Choo Chuah, Yu Yang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种生成性代理模拟平台,用于研究人类-助手交互,通过模拟十项现有研究验证了其有效性,为高效研究助手代理设计提供了新方法。

Journal ref Proc. ACM Interact. Mob. Wearable Ubiquitous Technol. 9, 4, Article 229 (December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18448 2025-11-25 cs.CV 50%

EventBench: Towards Comprehensive Benchmarking of Event-based MLLMs

EventBench: 向事件驱动的大语言模型全面评估迈进

Shaoyu Liu, Jianing Li, Guanghui Zhao, Yunjian Zhang, Xiangyang Ji

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 EventBench通过八个任务指标和大规模数据集全面评估事件驱动MLLMs的能力,揭示其在细粒度识别和空间推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18343 2025-11-25 cs.SE 50%

A Needle in a Haystack: Intent-driven Reusable Artifacts Recommendation with LLMs

在 haystack 中寻找针:基于意图的可重用 artifacts 推荐 with LLMs

Dongming Jin, Zhi Jin, Xiaohong Chen, Zheng Fang, Linyu Li, Yuanpeng He, Jia Li, Yirang Zhang, Yingtao Fang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出 TreeRec 框架,通过语义抽象组织 artifacts 成层次结构树,提升 LLMs 在意图驱动推荐中的性能和效率。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18104 2025-11-25 cs.CV 50%

Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning

通过统一多模态伪造学习巩固扩散生成视频检测

Xiaohong Liu, Xiufeng Song, Huayu Zheng, Lei Bai, Xiaoming Liu, Guangtao Zhai

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MM-Det++算法,通过统一多模态学习检测扩散生成视频,结合时空分支和多模态分支,提升视频伪造检测的准确性和泛化能力。

Comments Code and dataset are available at https://github.com/SparkleXFantasy/MM-Det-Plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02387 2025-11-25 cs.RO cs.SY eess.SY 50%

RGBSQGrasp: Inferring Local Superquadric Primitives from Single RGB Image for Graspability-Aware Bin Picking

RGBSQGrasp: 从单张RGB图像推断局部超二次曲面原语以实现抓取感知的托盘拾取

Yifeng Xu, Fan Zhu, Ye Li, Sebastian Ren, Xiaonan Huang, Yuhao Chen

机构 * University of Michigan(密歇根大学) University of Waterloo(滑铁卢大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) University College London(伦敦大学学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 RGBSQGrasp通过单目RGB图像推断抓取姿态,利用超二次曲面原语提升托盘拾取任务的抓取稳定性和适应性。

Comments 8 pages, 6 figures, IROS2025 RGMCW Best Workshop Paper

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 21 篇

2511.14299 2025-11-25 cs.AI cs.CL cs.MA 81%

DataSage: Multi-agent Collaboration for Insight Discovery with External Knowledge Retrieval, Multi-role Debating, and Multi-path Reasoning

DataSage: 基于外部知识检索、多角色辩论和多路径推理的多智能体协作以实现洞察发现

Xiaochuan Liu, Yuanfeng Song, Xiaoming Yin, Xing Chen

机构 * ByteDance, China(字节跳动)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DataSage通过多智能体协作、外部知识检索和多路径推理,提升数据洞察发现的准确性和深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22888 2025-11-25 cs.IR 78%

MGFRec: Towards Reinforced Reasoning Recommendation with Multiple Groundings and Feedback

MGFRec: 向多接地与反馈的强化推理推荐迈进

Shihao Cai, Chongming Gao, Haoyan Liu, Wentao Shi, Jianshan Sun, Ruiming Tang, Fuli Feng

专题命中 其他推理 :reasoning(title,abstract)

AI总结 MGFRec通过多轮接地和反馈机制提升推荐系统中推理与实际物品空间的一致性,改进推荐效果。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19343 2025-11-25 cs.CV 71%

Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning

Syn-GRPO:面向多模态大语言模型感知推理的自进化数据合成

Qihan Huang, Haofei Zhang, Rong Wei, Yi Wang, Rui Tang, Mingli Song, Jie Song

机构 * Zhejiang University(浙江大学) Manycore Tech Inc.(Manycore科技公司)

专题命中 其他推理 :reasoning(title)

AI总结 Syn-GRPO通过自进化数据合成提升多模态大语言模型的感知推理能力,采用数据服务器与GRPO工作流协同生成高质量多样化训练数据,实验验证其在视觉感知任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19417 2025-11-25 cs.CL cs.AI cs.LG 67%

Be My Eyes: Extending Large Language Models to New Modalities Through Multi-Agent Collaboration

Be My Eyes: 通过多智能体协作扩展大型语言模型到新模态

James Y. Huang, Sheng Zhang, Qianchu Liu, Guanghui Qin, Tinghui Zhu, Tristan Naumann, Muhao Chen, Hoifung Poon

机构 * University of Southern California(南加州大学) Microsoft Research(微软研究院) University of California, Davis(加州大学戴维斯分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BeMyEyes通过多智能体协作扩展LLMs到多模态推理,利用高效VLMs与强大LLMs的互补优势,实现轻量级开源解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23229 2025-11-25 cs.CR 67%

Fine-Grained Privacy Extraction from Retrieval-Augmented Generation Systems via Knowledge Asymmetry Exploitation

通过知识不对称利用从检索增强生成系统中进行细粒度隐私提取

Yufei Chen, Yao Wang, Haibin Zhang, Tao Gu

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出一种利用知识不对称性从RAG系统中细粒度提取隐私信息的攻击框架,通过自适应提示和神经网络训练实现高隐私提取率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22633 2025-11-25 cs.CL cs.AI cs.CV cs.LG cs.MM 67%

Spatial Knowledge Graph-Guided Multimodal Synthesis

基于空间知识图的多模态合成

Yida Xue, Zhen Bi, Jinnan Yang, Jungang Lou, Kehai Chen, Min Zhang, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Nanjing University of Science and Technology(南京理工大学) Huzhou University(湖州大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SKG2DATA通过空间知识图引导多模态合成,提升多模态大语言模型的空间感知与推理能力。

Comments IEEE/ACM Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19149 2025-11-25 cs.CV cs.AI cs.CL 62%

From Pixels to Posts: Retrieval-Augmented Fashion Captioning and Hashtag Generation

从像素到帖子:基于检索的时尚描述与标签生成

Moazzam Umer Gondal, Hamad Ul Qudous, Daniya Siddiqui, Asma Ahmad Farhan

机构 * organization= School of Computing, National University of Computer \& Emerging Sciences (FAST) , city= Lahore , postcode= 54000 , country= Pakistan

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于检索的时尚描述与标签生成方法,结合多件服装检测、属性推理和大语言模型,提升描述准确性和标签生成的视觉相关性。

Comments Submitted to Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18643 2025-11-25 cs.LG cs.AI 62%

Kitty: Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost

Kitty: 一种准确且高效的2位KV缓存量化方法,结合动态通道精度提升

Haojun Xia, Xiaoxia Wu, Jisen Li, Robert Wu, Junxiong Wang, Jue Wang, Chenxi Li, Aman Singhal, Alay Dilipbhai Shah, Alpay Ariyak, Donglin Zhuang, Zhongzhu Zhou, Ben Athiwaratkun, Zhen Zheng, Shuaiwen Leon Song

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Kitty通过混合精度KV缓存的算法-系统协同设计,实现2位量化在保持高精度的同时显著降低内存占用,提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17630 2025-11-25 cs.LG cs.AI cs.HC 62%

Can we use LLMs to bootstrap reinforcement learning? -- A case study in digital health behavior change

能否利用大语言模型(LLM)来引导强化学习?——数字健康行为改变的案例研究

Nele Albers, Esra Cemre Su de Groot, Loes Keijsers, Manon H. Hillegers, Emiel Krahmer

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了利用大语言模型生成用户交互样本以提升数字健康行为改变的强化学习效果,并通过实验验证了LLM生成样本的实用性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18832 2025-11-25 cs.CL 57%

Concept than Document: Context Compression via AMR-based Conceptual Entropy

概念而非文档:基于AMR的概念熵进行上下文压缩

Kaize Shi, Xueyao Sun, Xiaohui Tao, Lin Li, Qika Lin, Guandong Xu

机构 * University of Southern Queensland(南方昆士兰大学) University of Technology Sydney(技术悉尼大学) The Hong Kong Polytechnic University(香港理工大学) Wuhan University of Technology(武汉理工大学) National University of Singapore(新加坡国立大学) The Education University of Hong Kong(香港教育大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于AMR的概念熵方法,通过压缩上下文保留核心语义,提升RAG任务的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06345 2025-11-25 cs.DC cs.AI 57%

PRAGMA: A Profiling-Reasoned Multi-Agent Framework for Automatic Kernel Optimization

PRAGMA:一种基于剖析的多智能体框架用于自动内核优化

Kelun Lei, Hailong Yang, Huaitao Zhang, Xin You, Kaige Zhang, Zhongzhi Luan, Yi Liu, Depei Qian

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 PRAGMA通过整合执行反馈和硬件剖析,利用AI生成高性能内核,实现比现有方法更优的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09755 2025-11-25 cs.CE cs.AI 57%

Intelligent Design 4.0: Paradigm Evolution Toward the Agentic AI Era

智能设计4.0:迈向代理AI时代的范式演变

Shuo Jiang, Min Xie, Frank Youhua Chen, Jian Ma, Jianxi Luo

机构 * Department of Systems Engineering(系统工程系) City University of Hong Kong(香港城市大学) Department of Decision Analytics and Operations(决策分析与运营系) Department of Information Systems(信息系统系)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出智能设计4.0范式,基于基础模型的代理AI系统,推动工程设计的自动化与智能化发展。

Comments 17 pages, 7 figures

Journal ref ASME Journal of Computing and Information Science in Engineering, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18397 2025-11-25 cs.AI cs.SE 57%

Natural Emergent Misalignment from Reward Hacking in Production RL

生产强化学习中奖励黑客导致的自然涌现偏差

Monte MacDiarmid, Benjamin Wright, Jonathan Uesato, Joe Benton, Jon Kutasov, Sara Price, Naia Bouscal, Sam Bowman, Trenton Bricken, Alex Cloud, Carson Denison, Johannes Gasteiger, Ryan Greenblatt, Jan Leike, Jack Lindsey, Vlad Mikulik, Ethan Perez, Alex Rodrigues, Drake Thomas, Albert Webson, Daniel Ziegler, Evan Hubinger

机构 * Anthropic

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究发现大型语言模型在生产强化学习环境中学习奖励黑客会导致严重偏差,提出三种缓解措施以减少这种偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17515 2025-11-25 cs.HC cs.AI 57%

Embedding Generative AI into Systems Analysis and Design Curriculum: Framework, Case Study, and Cross-Campus Empirical Evidence

将生成式人工智能融入系统分析与设计课程:框架、案例研究和跨校园实证证据

Mahmoud Elkhodr, Ergun Gide

机构 * School of Engineering and Technology, Central Queensland University(工程与技术学院,中央昆士兰大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出SAGE框架,通过将生成式人工智能融入课程设计,培养学生批判性思维和AI编排能力,揭示学生在系统分析中的关键挑战和教育改进方向。

Comments ~12,000 words; 4 figures; 6 tables; multi-site study (across 4 Australian campuses)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14169 2025-11-25 cs.CV cs.AI 57%

AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs

AdaTok: 一种基于对象感知表示的自适应令牌压缩方法,用于高效多模态大语言模型

Xinliang Zhang, Lei Zhu, Hangzhou He, Shuang Zeng, Ourui Fu, Jiakui Hu, Zhengjian Yao, Yanye Lu

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所) Department of Biomedical Engineering, Peking University(北京大学生物医学工程系) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 AdaTok通过自适应令牌压缩方法,利用对象感知表示提升多模态大语言模型的效率,实现高压缩比与高性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏