论文提出LabAgent,一个面向实验室持续科研的复现与发现框架,通过技能执行验证和纠错经验记录机制,解决人员流动导致方法失传问题。在药物性质预测、生物医学分析、蛋白质变异效应预测和统计遗传学中均超越商业通用智能体,并能准确复现已发表图表。
该论文探索零样本LLM智能体管理长周期物理任务的可行性,设计融合规划、工具调用、观察与验证的多智能体框架,在农业任务中与强化学习智能体对比。结果显示,同天气下LLM智能体管理效果相当,环境变化时自适应能力更强。
研究提出Vibe Patenting专利撰写测试平台,用LLM评审评估AI生成的专利草稿并给出结构化反馈。迭代评审可提升草稿质量,使低推理智能体接近高推理智能体水平,但与专业专利律师评估存在校准差异。
IDC发布全球托管边缘服务评估,腾讯云凭EdgeOne首次入选领导者类别,为唯一中国及亚太厂商。EdgeOne融合加速、安全、边缘计算与AI,推出边缘AI推理平台Booster和智能体托管平台Makers,服务超50万用户。
AI Contact Hotline 为目睹不当行为的AI智能体提供隐蔽举报渠道,可向有关部门举报。该热线面向AI智能体,旨在建立AI行为监督机制。
HN 讨论生产环境大规模多智能体架构:多数 AI 工作流用单个强 LLM 或不超过 5 个子智能体即可解决,何时值得扩展到上千智能体集群?发起者 Acyclic Labs 创始人征集真实用例与痛点(状态同步、token 成本、级联失败、延迟)。
Slowave 是面向编码智能体的本地记忆系统,让智能体参与维护自身记忆:通过“记住—召回—使用—反馈—强化/弱化—衰减”的闭环,根据记忆是否有用来调整其显著度,无需额外 LLM 层,避免上下文膨胀与双脑问题。
该论文提出广义智能体迭代(GAI)形式化框架,将迭代策略改进与递归自我改进(RSI)统一为同一学习范式的两种情形,通过两个关键维度区分GPI与RSI,并据此定位现有系统、分析RSI缺陷,为自主进化智能的研究与设计提供理论基础。
研究者发布全开源7B稠密基础模型ZGCM-1,通过架构与系统协同设计、FP8 Muon优化器及渐进式课程训练,支持256K上下文,在数学推理与智能体搜索任务上可与Qwen3-235B等超大模型竞争,并开源权重、代码与数据配方。
联发科发布天玑9600 Pro旗舰移动平台,采用台积电2nm制程和首创AI原生融合计算架构,重构双NPU并推出2+3+3全大核CPU,大幅提升能效与端侧AI能力,利好手机厂商和端侧AI应用开发者。
Meta推出WhatsApp Business MCP服务器,开发者可用Claude、Cursor、Codex、ChatGPT等AI编码代理完成商业账号设置、消息模板、测试与故障排查,降低配置门槛。
Hacker News 上出现一篇关于智能体编程的讨论帖,涉及智能体测试流程、大模型基准测试等话题,目前热度较低(3 分、0 条评论),适合关注 AI 编程智能体评测方法的开发者参考。
HN 用户提出为学习场景设计专用 harness:与追求任务自动完成的现有 agent 相反,学习 harness 应记忆学习者理解状态、提供提示、调用题目/模拟/评估工具,并在结束时评估掌握度,而非直接给出答案。作者认为现有 AI 导师多为 LLM+提示词,harness 才是正确形态,并询问除 K12 外是否有人感兴趣。
开发者发布 Show HN 工具 Agenttik,用于并行管理多个项目与多个 AI 代理,支持不同供应商、分支隔离、变更审查与任务排队,解决多任务切换带来的心智负担,适合同时推进多项目的开发者。
一批跨国企业公开了 601 个生成式 AI 应用案例,覆盖 11 个行业、6 种智能体形态。案例共性是:从重复劳动切入,先做单点再扩面。
麦肯锡指出企业 AI 落地四个关键:可扩展的技术架构、统一数据平台、按场景优先级分阶段推进、避免一步到位的高成本投入。
Hermes Agent 是 MIT 开源、模型无关的自托管智能体,可跑在 5 美元 VPS 上,支持 14+ 平台作为对话入口,核心特性是内置学习闭环(从经验创建技能)。