arXiv:2609.20981v1 Announce Type: new Abstract: Autoregressive (AR) models suffer from local greediness, while
arXiv:2609.21061v1 Announce Type: new Abstract: Automatic target recognition (ATR) with synthetic aperture son
arXiv:2609.20971v1 Announce Type: new Abstract: Long-context large language model inference is increasingly li
arXiv:2609.20974v1 Announce Type: new Abstract: In Mixture-of-Experts language models, the router typically se
一篇立场论文提出,AI应用已从单一基础模型转向复合智能体系统,但各框架各自内嵌运行时,导致行为不可移植、治理脆弱。作者主张构建基础模型操作系统(FMOS),像虚拟机抽象硬件那样虚拟化基础模型交互,统一编排记忆、模型选择、资源分配与策略验证。
研究系统梳理2022年1月至2026年8月arXiv上14,767篇LLM评测资源论文,分析评测目标、材料与评分机制变化,发现评测日益强调行动、交互与专业应用,模型参与评分增多,并引发评测独立性的反思。
研究者发布 BioPhys-Bridge 基准,含 500 个案例、1517 项智能体任务,覆盖六个生物领域与九类物理模型,用于评估大模型在生物物理文献中的证据溯源与推理能力。初步评测中 DeepSeek-V4-Flash 证据 ID F1 最高(0.360)。
论文提出正则化强调时序差分学习(RETD),通过归一化一阶冲击后修复机制,在保持迹与重要性比不变的前提下改善恒定步长下的采样动力学稳定性,并证明调和递减步长的几乎必然收敛及条件矩收缩结果。
研究针对城市行人计数系统的隐蔽虚假数据注入攻击,提出物理约束数字孪生方法,利用流量守恒残差与自适应共形校准检测异常。在墨尔本六年数据上,单设备被攻陷时攻击裕度达0.54,三分之一设备被攻陷时降至0.19,验证了守恒律而非局部性的作用。
研究提出EvolveTrade框架,将工具型交易智能体的系统提示视为可文本参数化策略,由策略智能体依据决策轨迹与组合反馈定期修订,主干LLM保持固定。多市场环境与两种LLM实验显示,其夏普比率与累计收益多优于固定策略基线,可提升LLM交易智能体适应性。
论文提出“出版权威”概念及PAC-2026协议,用六项义务约束AI辅助主张的证据、授权与生命周期,仅完整全通过记录可授权一次原子出版;经11万余状态与183项测试验证内部一致性与有界安全性,但不保证事实真实性。
一篇立场论文指出,基于语言模型的开放式战略兵棋推演存在决策洗白、裁决不透明、角色崩塌、裁决升级、战略想象力失效五类风险,认为在缺乏可审计安全论证前,不应让此类模型影响规划、条令、政策或危机应对,其当前正确用途是作为压力测试工具。
研究者提出GPEvac框架,用图神经网络结合PPO强化学习,在枪击事件中实时计算自适应疏散路线,兼顾威胁暴露与拥挤动态,可跨不同建筑布局泛化,本地CPU仅需14.73毫秒即可生成全局路径,便于接入实时监控系统。
研究提出CRN v2轻量纠错模块(约34M参数),在完全冻结的Gemma 4 E2B上仅训练纠错模块,可修正53.3%的基座错误且不损害原有能力;而LoRA基线虽纠错率更高却损失30-75%能力,揭示纠错与能力保持的权衡。
arXiv新论文提出基于Fisher信息度量的模型空间测地距离剪枝方案,将参数置零视为模型位移,按测地距离近似层级构建最优剪枝方法体系。在MNIST和CIFAR-10上对全连接网络和视觉Transformer验证,全剪枝范围内精度与MCC均优于幅度剪枝和局部Fisher信息剪枝。
论文提出LabAgent,一个面向实验室持续科研的复现与发现框架,通过技能执行验证和纠错经验记录机制,解决人员流动导致方法失传问题。在药物性质预测、生物医学分析、蛋白质变异效应预测和统计遗传学中均超越商业通用智能体,并能准确复现已发表图表。
该论文探索零样本LLM智能体管理长周期物理任务的可行性,设计融合规划、工具调用、观察与验证的多智能体框架,在农业任务中与强化学习智能体对比。结果显示,同天气下LLM智能体管理效果相当,环境变化时自适应能力更强。
研究提出Vibe Patenting专利撰写测试平台,用LLM评审评估AI生成的专利草稿并给出结构化反馈。迭代评审可提升草稿质量,使低推理智能体接近高推理智能体水平,但与专业专利律师评估存在校准差异。
该论文提出广义智能体迭代(GAI)形式化框架,将迭代策略改进与递归自我改进(RSI)统一为同一学习范式的两种情形,通过两个关键维度区分GPI与RSI,并据此定位现有系统、分析RSI缺陷,为自主进化智能的研究与设计提供理论基础。
该论文提出 converge-then-diversify(CTD)方法,将多目标贝叶斯优化中的收敛与多样性解耦为两阶段:先快速逼近帕累托前沿单点,再扩展分布。在446组对比中,CTD在72.9%情况下优于现有方法,尤其适合评估预算紧张或高维问题。
研究者发布全开源7B稠密基础模型ZGCM-1,通过架构与系统协同设计、FP8 Muon优化器及渐进式课程训练,支持256K上下文,在数学推理与智能体搜索任务上可与Qwen3-235B等超大模型竞争,并开源权重、代码与数据配方。