2026-09论文中文摘要
教师应前瞻思考:面向可靠在线策略蒸馏的自适应续写
Teacher Should Think Ahead: Adaptive Continuations for Reliable On-Policy Distillation
arXiv 2609.22254 · 2026-09-22CAMFT:面向大语言模型的冲突感知可合并微调
CAMFT: Conflict-Aware Mergeable Fine-Tuning for Large Language Models
arXiv 2609.22253 · 2026-09-22CALM:一种用于基于活动的出行者仿真的校准LLM选择网络框架
CALM: A Calibrated LLM Choice Network Framework for Activity-Based Traveler Simulation
arXiv 2609.22252 · 2026-09-22预测器与编排器:智能体AI框架中的简约机器学习用于多时间尺度岩溶含水层预测
Predictors and Orchestrators: Parsimonious Machine Learning within an Agentic AI Harness for Multi-Horizon Karst Aquifer Forecasting
arXiv 2609.22251 · 2026-09-22外推:空间扩展气动光学相位屏
Outpainting: spatially extending aero-optic phase screens
arXiv 2609.22250 · 2026-09-22提示工程教程:从杂乱想法到AI工作流
A Tutorial on Prompt Engineering: From Messy Thoughts to AI Workflows
arXiv 2609.22249 · 2026-09-22检查点并不足够:CoSLR——一个用于系统文献综述的人机协同系统中的信任校准
Checkpoints Are Not Enough: Trust Calibration in CoSLR, a Human-AI System for Systematic Literature Reviews
arXiv 2609.22248 · 2026-09-22CHART:一种用于搜索智能体的挽具轮换课程训练方法
CHART: A Harness-Rotation Curriculum for Harness-Robust Search Agents
arXiv 2609.22247 · 2026-09-22证实错觉:当更多新闻使LLM预测更不准确时
The Corroboration Illusion: When More News Makes LLM Forecasts Less True
arXiv 2609.22246 · 2026-09-22棋局解释是否反映模型决策?LLM推理忠实度的行为与词元级测试
Do Chess Explanations Reflect Model Decisions? Behavioral and Token-Level Tests of LLM Reasoning Faithfulness
arXiv 2609.22245 · 2026-09-22通用天文台图:用于分布式天空覆盖和基于人工智能的行星际路由
Universal Observatory Graphs for Distributed Sky Coverage and Artificial Intelligence Based Interplanetary Routing
arXiv 2609.22244 · 2026-09-22重放门控神经执行:将持久行为规范与冻结语言模型中的神经实现解耦
Replay-Gated Neural Execution: Decoupling Persistent Behavioral Specifications from Neural Realizations in Frozen Language Models
arXiv 2609.22243 · 2026-09-22H2LooP 电信模型 v1:从电信理解到自主问题与 PR 解决
H2LooP Telecom Model v1: From Telecom Comprehension to Autonomous Issue and PR Resolution
arXiv 2609.22241 · 2026-09-22对抗训练的统计推断:基于最优传输的中心极限定理
Statistical Inference for Adversarial Training: Central Limit Theorems via Optimal Transport
arXiv 2609.22240 · 2026-09-22知识图谱增强的环境人工智能用于临床笔记生成
Knowledge Graph-Augmented Ambient AI for Clinical Note Generation
arXiv 2609.22239 · 2026-09-22并非所有秩都平等:跨任务预算感知的LoRA合并
Not All Ranks Are Equal: Budget-Aware LoRA Merging Across Tasks
arXiv 2609.22237 · 2026-09-22BER感知的里德伯原子量子接收机联合参数优化
BER-Aware Joint Parameter Optimization of Rydberg Atomic Quantum Receivers
arXiv 2609.22236 · 2026-09-22BizSage:面向商业研究的高效知识检索自进化多智能体框架
BizSage: A Self-Evolving Multi-Agent Framework for Business Research with Efficient Knowledge Retrieval
arXiv 2609.22235 · 2026-09-22透视冲突:提升视觉-语言模型中的指令层级对齐
Seeing Through Conflicts: Improving Instruction Hierarchy Alignment in Vision-Language Models
arXiv 2609.22234 · 2026-09-22SCALE:面向能源材料的仿真校准摊销学习(一种连接确定性建模、真实世界数据与Transformer规模推理的混合架构,用于加速能源材料发现)
SCALE: Simulation-Calibrated Amortized Learning for Energy Materials (A hybrid architecture connecting deterministic modeling, real-world data, and transformer-scale inference for accelerated energy-materials discovery)
arXiv 2609.22233 · 2026-09-22CNA:一种面向AI的健康状态综合归一化评估及其在强化学习优化RRT策略中的应用
CNA: An AI-Oriented Comprehensive Normalized Assessment for Healthy Status and Application to Optimize RRT Strategies by Reinforcement Learning
arXiv 2609.22232 · 2026-09-22EvalMem:长期记忆系统的操作级诊断框架
EvalMem: An Operation-Level Diagnostic Framework for Long-Term Memory Systems
arXiv 2609.22231 · 2026-09-22列表计数失败并非单一现象
List Counting Failures Are Not One Phenomenon
arXiv 2609.22230 · 2026-09-22用于预测性维护的合成多元冰箱时间序列数据集
A Synthetic Multivariate Refrigerator Time-Series Dataset for Predictive Maintenance
arXiv 2609.22229 · 2026-09-22评估潜在推理模型的对抗鲁棒性
Assessing Adversarial Robustness of Latent Reasoning Models
arXiv 2609.22228 · 2026-09-22引导语义ID的粗粒度层级使细粒度层级可学习
Guiding the coarse levels of semantic IDs makes the fine levels learnable
arXiv 2609.22227 · 2026-09-22Swiss-Knife:一种解码时重配置外部化多目标对齐框架
Swiss-Knife: A Framework for Reconfigurable Externalised Multi-Objective Alignment at Decode Time
arXiv 2609.22226 · 2026-09-22大型语言模型是否像人类一样决策?用认知理论评估LLM决策
Do LLMs Choose Like Humans? Using Cognitive Theory to Evaluate LLM Decision-Making
arXiv 2609.22225 · 2026-09-22从特征向量到电路:追踪语言模型中的拒答与谄媚行为
From Trait Vectors to Circuits: Tracing Refusal and Sycophancy Through Language Models
arXiv 2609.22224 · 2026-09-22EAVer: 长文本事实性验证作为端到端智能体策略
EAVer: Long-Form Factuality Verification as an End-to-End Agentic Policy
arXiv 2609.22223 · 2026-09-22编码智能体能否复现官方统计?受控Eurostat基准中的元数据、重试预算与执行反馈的局限
Can Coding Agents Reproduce Official Statistics? Metadata, Retry Budget and the Limits of Execution Feedback in a Controlled Eurostat Benchmark
arXiv 2609.22222 · 2026-09-22Team DArgk 在 2026 年 ELOQUENT 实验室评估生成式语言模型质量中的表现:人性的残余:通过 GRPO 微调实现 AI 检测规避
Team DArgk at the 2026 ELOQUENT lab for evaluating generative language model quality: Residuals of Humanity: AI Detection Evasion via GRPO Fine-Tuning
arXiv 2609.22221 · 2026-09-22测量检查器:GPU 内核基准测试预言机的变异分析
Measuring the Checker: Mutation Analysis for GPU-Kernel Benchmark Oracles
arXiv 2609.22220 · 2026-09-22知晓,且仅在询问时说出:LLM 内诊学与 Minerva-7B 的精神分裂认知
Knowing, and Saying It Only When Asked: LLM Endognostics and the Schizognosis of Minerva-7B
arXiv 2609.22219 · 2026-09-22Toollery:将LLM智能体扩展到数千技能与工具
Toollery: Scaling LLM Agents to Thousands of Skills and Tools
arXiv 2609.22218 · 2026-09-22UniGIO:基于时空不完整观测的统一生成式全球原位天气建模
UniGIO: Unified Generative Global In-situ Weather Modeling from Spatiotemporal Incomplete Observations
arXiv 2609.22217 · 2026-09-22量化对临床基准的影响:不同模型家族的准确性与安全性
The Effect of Quantization on Clinical Benchmarks: Accuracy and Safety Across Model Families
arXiv 2609.22216 · 2026-09-22论大语言模型中潜意识学习的缓解
On Mitigation of Subliminal Learning in Large Language Models
arXiv 2609.22215 · 2026-09-22百融系统在MLC-SLM 2026中的表现:面向多语言对话语音理解的动态问题感知证据路由
The Bairong System for MLC-SLM 2026: Dynamic Question-Aware Evidence Routing for Multilingual Conversational Speech Understanding
arXiv 2609.22214 · 2026-09-22SCoP:时间知识图谱问答中证据空间控制的结构化约束解析
SCoP: Structured Constraint Parsing for Evidence-Space Control in Temporal Knowledge Graph Question Answering
arXiv 2609.22213 · 2026-09-22一个用于科学相机自动化操作与表征测试的可扩展软件平台
An extensible software platform for automated operational and characterization testing of scientific cameras
arXiv 2609.22211 · 2026-09-22SALSA:半自主文献摘要助手
SALSA: Semi-Autonomous Literature Summarization Assistant
arXiv 2609.22210 · 2026-09-22Schematize:用于生成和优化法律研究信息抽取模式(Schema)的智能体系统
Schematize: An Agentic System for Generating and Refining Information-Extraction Schemas for Legal Research
arXiv 2609.22209 · 2026-09-22在基础开放权重模型中复现情绪表征的几何结构
Replicating the Geometry of Emotion Representations in a Base Open-Weights Model
arXiv 2609.22208 · 2026-09-22用于高密度脑机接口的植入体到可穿戴设备IR-UWB收发器架构与分层协议
An Implant-to-Wearable IR-UWB Transmitter-Receiver Architecture and Layered Protocol for High-Density Brain-Computer Interfaces
arXiv 2609.22207 · 2026-09-22多模态大语言模型中免训练不确定性估计的剖析
Dissecting Training-Free Uncertainty Estimation in Multimodal Large Language Models
arXiv 2609.22206 · 2026-09-22基于储层计算预测跳跃四分之一车模型中的非线性振荡
Prediction of Nonlinear Oscillations in a Jumping Quarter-Car Model Using Reservoir Computing
arXiv 2609.22205 · 2026-09-22评估生成式AI系统中对话交互的个人信息输出
Evaluating Personal Information Output from Conversational Interactions in Generative AI Systems
arXiv 2609.22204 · 2026-09-22去噪而非填补空缺:稀疏室外BLE定位中的缺失数据处理
Denoising Rather Than Gap Filling: Missing-Data Handling in Sparse Outdoor BLE Positioning
arXiv 2609.22203 · 2026-09-22基于算子的合成系统性风险动态可视化分析流水线
An Operator-Based Visual Analytics Pipeline for Synthetic Systemic Risk Dynamics
arXiv 2609.22202 · 2026-09-22