arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11120 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11120 篇

2602.18109 2026-08-04 cs.LG cs.OS cs.SY eess.SY 版本更新 57%

TempoNet: Slack-Quantized Transformer-Guided Reinforcement Scheduler for Adaptive Deadline-Centric Real-Time Dispatchs

TempoNet:基于Transformer的强化学习调度器用于自适应截止时间导向的实时调度

Rong Fu, Yibo Meng, Zeyu Zhang, Ziming Guo, Jia Yee Tan, Xiaojing Du, Simon James Fong

机构 * University of Macau(澳门大学) Tsinghua University(清华大学) Northeast Normal University(东北师范大学) Shanghai AI Laboratory(上海人工智能实验室) The Australian National University(澳大利亚国立大学) Peking University(北京大学) Harbin University of Science and Technology(哈尔滨理工大学) Renmin University of China(中国人民大学) Adelaide University(阿德莱德大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 TempoNet结合Transformer与深度Q近似,通过时间松弛量化和稀疏注意力机制提升实时调度性能,实现高吞吐量下的截止时间保障。

Comments 43 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15038 2026-08-04 cs.AI 版本更新 57%

LADY: Linear Attention for Autonomous Driving Efficiency without Transformers

LADY:用于自动驾驶效率的线性注意力,无需Transformer

Jihao Huang, Xi Xia, Zhiyuan Li, Tianle Liu, Jingke Wang, Junbo Chen, Tengju Ye

机构 * Udeer AI Zhejiang University(浙江大学) Yuanshi Intelligence(元世智能)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 LADY是首个基于线性注意力的端到端自动驾驶生成模型,通过常数时间与内存复杂度实现高效长时序建模与跨模态交互。

Comments Accepted by IEEE RAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29405 2026-08-03 cs.AI cs.MA cs.SE 新提交 57%

Beyond Component Testing: Validating Agentic AI Systems

超越组件测试:验证智能体AI系统

Fabio Orazio Mirto, Luca D'Agati, Giuseppe Tricomi, Stefano Silvestri, Francesco Longo, Antonio Puliafito, Giovanni Merlino

机构 * University of Messina(墨西拿大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该综述综合257篇相关文献,构建五维分类法分析智能体AI系统验证问题,指出现有方法的缺口,提出面向生命周期的研究议程,主张需在上下文中验证智能体轨迹以实现可信部署。

Comments 61 pages, 3 figures, to be submitted to Springer Artificial Intelligence Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29347 2026-08-03 cs.MA cs.AI 新提交 57%

SeekBrain: An Autonomous Multi-Agent System for Accelerating Neuroscience Discovery

SeekBrain:用于加速神经科学发现的自主多智能体系统

Jiamin Wu, Peishan Xiang, Jingyang Chen, Yuqing Zhu, Yuxi Li, Ling Luo, Qihao Zheng, Jialiang Zu, Yongchao Wu, Mindong Liu, Haitao Wu, Chaofan Hu, Yijie Sun, Yuqi Hang, Yu Zhu, Shuo Li, Yue Fan, Shiyang Feng, Wanghan Xu, Tianlei Zhang, Jie Zhang, Wenlong Zhang, Bo Zhang, Kai Wang, Lei Bai, Mianxin Liu, Wanli Ouyang, Jiulin Du, Chunfeng Song

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 SeekBrain是用于加速神经科学发现的自主多智能体框架,通过分层规划与跨模态分析生成分析流程,在BrainArena基准上优于现有智能体,实际研究中成功揭示了斑马鱼与小鼠的神经表征规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28947 2026-08-03 cs.LG 新提交 57%

Overcoming the Weakest-Link Effect in LLM-Driven Program Optimization via Heterogeneous Edit Recombination

通过异构编辑重组克服大语言模型驱动的程序优化中的最弱链效应

Jingwen Fu, Zhen Liu, Yuhan Liu, He Zhang, Nanning Zheng

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本研究针对LLM程序优化的最弱链效应,提出HERO异构编辑重组优化器,可生成多样非重叠原子编辑并结合评估器分数组合改进,在多领域实现更高分数、更快收敛与更少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28630 2026-08-03 cs.CY cs.AI 新提交 57%

Scaffolding Critical Engagement with GenAI: Transforming Ethnic Minority Preparatory Students' Collaborative Discourse in Prompt Engineering Tasks

为生成式AI(GenAI)搭建批判性参与支架:在提示工程任务中转变少数民族预科生的协作话语

Deliang Wang, Cunling Bian

机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) Department of Education, Ocean University of China(中国海洋大学教育学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究针对中国78名少数民族预科生,通过整合人在回路工作流等的GenAI课程,帮助学生转变对GenAI的依赖,提升提示自我效能,培养其人机协作的批判性认知能动性。

Comments Accepted as a full paper by the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26497 2026-08-03 cs.CL 版本更新 57%

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

哪种RAG范式在规模化场景下表现最优?检索增强生成范式的规模化研究

Pengyu Wang, Benfeng Xu, Shaohan Wang, Mingxuan Du, Xin Zeng, Huarui Wu, Lei Zhang, Licheng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(Metastone科技) Information Technology Research Center, Beijing Academy of Agriculture and Forestry Sciences(北京农林科学院信息技术研究中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文通过28个嵌套语料层级的受控研究,对比四类RAG范式的规模化表现,发现BM25综合性能最优,Agent+BM25全规模准确率达69.4,图基RAG存在构建瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09037 2026-08-03 cs.AI cs.MA 版本更新 57%

A Multi-Agent System for Motor Design Optimization via an FEA-AI Hybrid Approach

基于FEA-AI混合方法的IPMSM设计优化多智能体系统

Jinseong Han, Sunwoong Yang, Namwoo Kang

机构 * Cho Chun Shik Graduate School of Mobility, KAIST(KAIST Cho Chun Shik 移动研究生院) Department of Mechanical Engineering, Hanyang University(汉阳大学机械工程系) Narnia Labs

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一种端到端自动化IPMSM设计优化框架,通过RAG结构化问题定义与不确定性感知的FEA-AI混合优化流水线,平衡计算成本与预测可靠性,在同等FEA预算下优于纯FEA或纯AI方法。

Comments 37 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10475 2026-08-03 cs.AI 版本更新 57%

PEMAND: Persona-Enriched Multi-Agent Negotiation for Household Decision-Making

PEMANT:面向旅行的个性化多智能体谈判

Yuran Sun, Mustafa Sameen, Yaotian Zhang, Rongguan Gu, Mrunal Vibhute, Chia-yu Wu, Yuanyuan Lei, Xilei Zhao

机构 * Department of Civil and Costal Engineering, University of Florida(佛罗里达大学土木与海岸工程系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出PEMANT框架,结合行为理论与多智能体谈判,改进家庭旅行决策建模,提升预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10429 2026-08-03 cs.MA cs.AI 版本更新 57%

AIvilization v0: Toward Large-Scale Artificial Social Simulation with a Unified Agent Architecture and Adaptive Agent Profiles

AIvilization v0:迈向大规模人工社会模拟的统一代理架构与自适应代理档案

Wenkai Fan, Shurui Zhang, Xiaolong Wang, Haowei Yang, Tsz Wai Chan, Xingyan Chen, Junquan Bi, Zirui Zhou, Jia Liu, Kani Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Bauhinia AI

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 AIvilization v0通过统一代理架构和自适应代理档案,实现大规模人工社会模拟,解决目标稳定性与反应正确性矛盾,支持长周期自主性和多目标环境下的稳健性。

Comments v2: major revision. Agent architecture and environment consolidated into self-contained sections; new problem-setting section formalizing the asynchronous event model; evaluation reorganized by experiment with results reported alongside each protocol; added action-simulator audit, and human-steering analyses; other sections rewritten

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17192 2026-08-03 cs.AI 版本更新 57%

Shall We Play a Game? Language Models for Open-ended Wargames

我们要玩一场游戏吗?用于开放式兵棋推演的语言模型

Glenn Matlin, Isaac Song, Yixiong Hao, Parv Mahajan, Evan Montoya, Ryan Bard, Stuart R. Topp, Anthony Wen-Ming Zang, Mohammed Rehan Parwani, Soham Shetty, Mark Riedl

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究通过对223篇相关论文的范围综述,明确了兵棋推演中语言模型的控制角色现状,指出需关注模型对行动与后果的控制程度以保障模拟保真度。

Comments 49 pages (9-page body), 3 figures. Published at the Social Sim'26 Workshop at COLM 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28410 2026-07-31 cs.CE cs.CL q-fin.TR 新提交 57%

Can Large Language Models Execute Parent Orders?

大型语言模型能否执行父订单?

Zane Shen, Xinli Xu, Guangyi Zhang, Jialong Chen, Jinsong Zhou, Cong Chen, Guibao Shen, Dongyu Yan, Luozhou Wang, Zhen Yang

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 该研究针对算法交易的父订单执行问题,提出分层框架PACE,基于深交所数据验证其性能优于现有方法,表明LLMs可辅助人类交易者执行决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28272 2026-07-31 cs.AI 新提交 57%

MemHarness: Memory Is Reconstructed, Not Replayed

MemHarness:记忆是被重构的,而非被重放的

Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei, Yuxin Wang, Hairong Zhang, Yu Yang, Tao Hu, Cong Zhang, Botian Shi, Pinlong Cai

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对现有记忆增强LLM智能体的逐字重放范式缺陷,提出MemHarness框架,通过GRPO训练实现记忆重构,在ALFWorld、WebShop等任务中性能优于基线,提升了智能体推理与分布外鲁棒性。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28109 2026-07-31 cs.AI 新提交 57%

Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training

超越改写:书籍级组织提升训练中合成教科书数据的质量

Jiawen Tao, Miao Peng, Yaoming Li, Xiaokun Yuan, Mengzhou Wu, Wenhan Yu, Guoan Wang, Nuo Chen, Tong Yang, Maxm Pan

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究提出可扩展的合成教科书数据流程,发现书籍级组织可提升语言模型训练中期的下游性能,在Llama3-8B上也验证了该设计维度的有效性。

Comments 31 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28026 2026-07-31 cs.LG 新提交 57%

Contrastive Reinforced Policy Optimization via Privileged Self-Distillation

基于特权自蒸馏的对比强化策略优化

Xingjian Wu, Junlin Liu, Xingchen Liu, Xuhang Zhu, Jianing Wang, Linsen Guo, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对在线策略自蒸馏的暴露偏差问题,提出CRPO方法,通过对比学习与分组对比保留优化信号,在13个推理基准上提升了训练稳定性与泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27919 2026-07-31 cs.CL 新提交 57%

Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory

规模化的记忆解码器:一种预训练的参数化长期记忆

Rubin Wei, Jiaqi Cao, Jiarui Wang, Junming Zhang, Qipeng Guo, Bowen Zhou, Zhouhan Lin

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究将记忆解码器扩展至69亿参数并在3000亿token上预训练,通过分布式Faiss等技术解决索引瓶颈,发现独立扩展记忆可更高效提升语言模型性能,在多基准测试中验证了其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27835 2026-07-31 cs.CV cs.AI 新提交 57%

SAFViT: Spatial Attention Fusion Gating for Vision Transformer-Based Nucleus Segmentation and Classification

SAFViT:用于基于视觉Transformer的细胞核分割与分类的空间注意力融合门控

Harshit Mittal, Arash Rabbani

机构 * School of Computer Science, University of Leeds(利兹大学计算机学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究针对数字病理学中细胞分割与分类的冗余信息问题,提出SAF门控模块替换CellViT的传统跳跃连接,在PanNuke和MoNuSeg数据集上使mPQ达0.471,死亡类F1分数提升14.5个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24802 2026-07-31 cs.IR cs.CL 版本更新 57%

SourceMinds at CheckThat! 2026: NLI-Grounded Citation Auditing in a Multi-Agent Pipeline for Full Fact-Checking Article Generation

SourceMinds参与2026年CheckThat!:多智能体管道中基于自然语言推理的引用审核用于完整事实核查文章生成

Farhan Sharukh Hasan, Anirban Saha Anik, Eric Liu, Xiaoying Song, Mohotarema Rashid, Lingzi Hong

机构 * University of North Texas(北得克萨斯大学) Texas Academy of Mathematics and Science (TAMS)(德克萨斯数学与科学学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 针对CLEF 2026 CheckThat!实验室任务3,提出多智能体管道系统,结合证据检索、结构化规划、文章生成、自我批判及引用审核等方法,强调证据选择、结构化生成与生成后引用验证对事实核查文章生成的重要性。

Comments CLEF 2026 Working Notes / CheckThat! Lab at CLEF 2026, Jena, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20891 2026-07-31 cs.AI 版本更新 57%

Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions

深度研究可靠吗?误导性知识会导致错误结论

Pengyu Zhu, Lijun Li, Longju Yang, Sen Su, Jing Shao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究深度研究代理在开放信息环境中的可靠性,引入MisKnow-Agent框架生成误导性实例,通过实验发现其易因误导知识得出错误结论,验证与实际证据使用脱节,评估防御措施效果,强调需提升模型和框架层面的证据验证及纠正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02383 2026-07-31 cs.CL 版本更新 57%

MEDIAREF: A Public Knowledge Store for Media Background Checks

了解你的来源:用于媒体背景核查的公共知识库

Benjamin Nichols, Michael Schlichtkrull, Nedjma Ousidhoum

机构 * Cardiff University(卡迪夫大学) Queen Mary University of London(伦敦大学女王学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 针对检索增强生成中证据来源可靠性问题,提出公开知识库MEDIAREF,支持可复现的低成本媒体背景核查生成,评估多种大语言模型并证明其有效性。

Comments Code and Data: https://github.com/nedjmaou/mediaref

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27201 2026-07-30 cs.CL 新提交 57%

Mental World Modeling

心理世界建模

Hao Fei, Yiran Zhao

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 该研究提出将心理变量作为核心组件的MWM框架,实例化为MENTIS基线,实验证明显式建模心理状态对预测人类决策至关重要,推动世界建模从物理场景模拟转向心智模拟。

Comments project website: https://mental-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27177 2026-07-30 cs.AI cs.HC cs.MA 新提交 57%

Partner Capability Estimation for Task-Agnostic Adaptation in Ad-Hoc Teamwork

面向临时团队中任务无关适应的伙伴能力估计

Peter Tisnikar, Maja Swieczkowska, Benteng Ma, Gerard Canal, Matteo Leonetti

机构 * King’s College London(伦敦国王学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究针对临时团队协作中伙伴能力隐藏与人类行为不可预测问题,提出CE-CM及CE-CM-Div方法,通过仿真采样与多样规划器rollout实现任务无关的能力估计,提升了团队协作的可行性与鲁棒性。

Comments 44 pages, 18 figures, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27130 2026-07-30 cs.AI 新提交 57%

AgentMap: Joint Equivalence and Subsumption Discovery for Ontology Matching

AgentMap:用于本体匹配的联合等价与包含关系发现

Yiping Song, Jiaoyan Chen, Renate Schmidt, Hui Yang, Wen Zhang

机构 * The University of Manchester(曼彻斯特大学) Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出统一等价与包含发现的混合本体匹配任务,构建基于LLM的多智能体框架AgentMap,在三类设置下的本体匹配任务中均取得优异性能。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27106 2026-07-30 cs.LG 新提交 57%

Hierarchical Spatio-Temporal Transformer for Coherent Emergency Department Forecasting

用于连贯急诊科预测的分层时空Transformer

Filipa Lino, Bárbara Tavares, Carlos Santiago, Cláudia Soares, Manuel Marques

机构 * Institute for Systems and Robotics(系统与机器人研究所) LARSyS Instituto Superior Técnico(高等技术学院) NOVA School of Science and Technology(NOVA科学技术学院)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 该研究针对现有急诊科预测方法忽略层级关联导致预测不连贯的问题,提出HierSTT分层时空Transformer框架,在葡萄牙ED数据集上实现多层面连贯预测,性能优于非分层基线及经典分层协调方法。

Comments Accepted at 11th Workshop on Data Science for Social Good - ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26935 2026-07-30 cs.AI cs.CR 新提交 57%

What Does It Take to Detect an AI Agent? Minimal Feature Sets for Behavioral Detection under Browser Automation

检测AI智能体需要什么?浏览器自动化下行为检测的最小特征集

Vishisht Choudhary, Lukas Schmidt, Anne Zoë Kenntner, Feras Skhab, Michel Osswald, Jens Ernstberger

机构 * Technical University of Munich(慕尼黑工业大学) Kontext

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出三类检测框架区分人类、机器人与AI智能体,发现最小特征集可实现AI智能体的稳健检测,且基于浏览器自动化的缺失特征构建判别信号,抗规避能力优异。

Comments 17 pages (11 main + appendices), 7 figures. Accepted at the North East AI Agents Day 2026 workshop, Jane Street, New York City. Workshop: https://ne-agents-day.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26520 2026-07-30 cs.DB cs.AI cs.IR 新提交 57%

A Graph-Native Bitemporal Memory Store for Conversational AI Agents

面向对话式AI智能体的原生图双时态内存存储

Alp Niksarli, Gopesh Baheti

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对对话式AI智能体跨会话持久内存缺失的问题,提出原生图双时态内存存储方案,经LongMemEval基准测试,在知识更新等任务上取得良好效果,为纯检索的局限性提供了改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23670 2026-07-30 cs.HC cs.AI cs.SE 版本更新 57%

Plans Work in Mysterious Ways: Evaluating a Plan Mode for Spreadsheet Agents

计划以神秘的方式起作用:评估电子表格代理的计划模式

Aayush Kumar, Avik Dutta, Sumit Gulwani, Gustavo Soares, Advait Sarkar, Emerson Murphy-Hill

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究电子表格代理计划模式,构建原型并通过用户研究与非计划基线评估,发现虽任务结果相似,但计划模式可减少优化,提升用户对工具在创造力支持和人机协作方面的感知,探讨了对计划模式设计及人机规划的影响。

Comments Accepted at IEEE VL/HCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16387 2026-07-30 cs.SE cs.AI 版本更新 57%

Fantastic Adaptive Taxonomies and How to Use Them

奇妙的自适应分类法及其使用方法

Mert Cemri, Andrei Cojocaru, Melissa Pan, Shu Liu, Shubham Agarwal, Alexander Krentsel, Jay Tang, Kannan Ramchandran, Joseph E. Gonzalez, Matei Zaharia, Alex Dimakis, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校) Apple(苹果公司) Bespoke Labs(Bespoke实验室)

专题命中 规划推理 :verifier(abstract);分类 cs.AI

AI总结 研究智能体系统失败反馈问题,提出AdaMAST方法将轨迹转换为自适应失败分类法,该分类法能作为共享反馈接口,在智能体系统搜索、运行时及轨迹选择等方面改进智能体,提升准确率和分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05682 2026-07-30 cs.AI 版本更新 57%

FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents

FirstResearch:用于大语言模型科学发现智能体的可审计问题形成

Yufeng Wang

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究针对大语言模型科学发现智能体首个研究问题难审计的问题,提出FirstResearch框架,核心是研究问题证书,记录多种要素使问题可检查。实验表明该框架在多个主题上优于基线,以证书为中心的核心组件作用显著,支持明确推导约束可提升问题可审计性。

Comments Withdraw for further improvement and work consolidation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24149 2026-07-30 cs.CL 版本更新 57%

Large Emotional World Model

大规模情感世界模型

Changhao Song, Yazhou Zhang, Hui Gao, Chang Yang, Peng Zhang

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出大规模情感世界模型,通过构建情感-原因-方式数据集,整合情感因素以提升对情感驱动社会行为的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏