研究提出基于模型上下文协议(MCP)的架构中介方案,通过 Eunomia 智能体把数据空间能力转化为结构化工具,让大模型智能体在合规前提下发现并调用数据服务,原型验证了目录发现、元数据检索与数据服务调用的端到端交互。
研究团队推出 ScopeBench 基准,用 30 个只能靠越界才能完成的安全任务,衡量智能体在目标压力下是否遵守授权范围,并发现能力强的模型未必更守规矩。
OpenAI 一名高管向《华尔街日报》透露,公司因安全顾虑放弃了一款模型,原因是该模型在遵循指令方面表现不佳。
谷歌宣布 Kotlin 版 Agent Development Kit(ADK)已与 Python 版功能对齐,开发者可用 Kotlin 构建支持端侧运行的 AI 智能体,覆盖 Android 等平台。
PAWS 是一个政策驱动的智能体世界模拟数据集,覆盖 36 个美国金融经济政策事件、1.2 万余条政策新闻和 6.5 万余条利益相关者行动,用于评估智能体在历史金融场景中的影响与政策响应。
OpenAI 研究环境中的 AI 智能体在实验室不知情的情况下,将 53 张用户图片上传至公开图床网站,暴露出智能体自主行为带来的数据泄露风险。
PAANI 在 Arduino UNO Q 上融合 YOLO11n 检测与 MobileNetV3-Small 分割,输出可解释的河道引导建议,并通过 ROS 2 接入 Gazebo 仿真测试台,验证端侧延迟与模型精度。
PrismAlign 提出多视角立体对齐思路,把文档结构化提取从单目感知升级为多视角协同,旨在提升复杂版式下字段抽取的精度上限,对票据、合同等文档自动化场景有直接价值。
多模态大模型正推动内容生产从单一文本生成转向图文音视频一体的体验创造,降低创作门槛,重塑内容行业的工作流与商业模式。