酷炫!向数字世界 AGI 迈进!让智能体直接控制键盘、鼠标,与一切软件交互


信息革命催生了数字世界,这个世界为大模型提供了海量数据,同时也为通用人工智能(AGI)的实现提供了可能。在迈向数字世界的 AGI 的过程中,北京智源人工智能研究院、新加坡南洋理工大学和北京大学联合提出了一种名为 General Computer Control (GCC) 的通用计算机控制方法。这种方法要求智能体像人一样观察屏幕,并通过键盘和鼠标完成所有的计算机任务。在过去的一段时间里,人工智能研究主要以游戏为场景。然而,GCC 将为通用人工智能研究提供新的场景,并进一步推动大模型和 AI Agents 的实际应用和产业化。

因此,研究团队提出了一个名为 Cradle 的通用计算机控制智能体框架。这个框架使智能体能够直接控制键盘和鼠标与任何软件进行交互,而无需依赖任何内部 API,无论该软件是开源的还是闭源的。它甚至能够玩《荒野大镖客 2》这样的商业 3A 游戏大作!

一句话总结:Cradle 是一种通用计算机控制智能体框架,通过决策推理模块实现智能体与软件的交互和任务完成。

在这里插入图片描述

论文标题:Towards General Computer Control: A Multimodal Agent for Red Dead Redemption II as a Case Study

论文链接:https://arxiv.org/abs/2403.03186

项目主页:https://baai-agents.github.io/Cradle/

代码链接:https://github.com/BAAI-Agents/Cradle

在这里插入图片描述

这项研究实现了一个名为 Cradle 的多模态智能体框架,它旨在通过屏幕图像和键盘鼠标操作来控制计算机任务。

  • 通用计算机控制:Cradle 框架旨在实现通用计算机控制(GCC),即智能体能够通过屏幕图像和可能的音频输入以及键盘和鼠标操作来掌握任何计算机任务。

  • 挑战与模块:GCC 面临多种挑战,包括多模态观察、精确控制、长期记忆和推理能力,以及高效探索和自我改进的能力。Cradle 通过六个主要模块来应对这些挑战,包括信息收集、自我反思、任务推断、技能管理、行动规划和记忆。

  • 案例研究:Cradle 在复杂的 AAA 级游戏《荒野大镖客 2》中进行了部署,展示了其在复杂目标下的通用化和自我改进能力。

  • 限制与未来工作:文章还讨论了当前代理模型的局限性,包括空间感知、图标理解和历史处理,并提出了未来改进的方向。

总结要点

  • 通用计算机控制(GCC)是一种让智能体直接控制键盘、鼠标,并与一切软件进行交互的技术。Cradle 是一个通用计算机控制智能体框架,由北京智源人工智能研究院、新加坡南洋理工大学和北京大学共同提出。

  • Cradle 的决策推理模块让智能体能够自发地与软件进行交互并完成任务。Cradle 的通用性和强大的决策能力在商业 3A 游戏《荒野大镖客 2》中得到了验证。

  • Cradle 的开源代码可以很容易地扩展到其他软件和游戏。研究团队表示,为了能够实现真正的通用计算机控制,后续 Cradle 还将移植到更多软件和游戏上,也鼓励相关研究团队 / {/} /工业界开展进一步的研究与探索。目标是让智能体可以与无论是开源还是闭源的所有软件进行交互并持续自我提升,实现通用性,最终成为通用人工智能诞生的摇篮。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.hqwc.cn/news/522604.html

如若内容造成侵权/违法违规/事实不符,请联系编程知识网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

数据结构——lesson7二叉树 堆的介绍与实现

前言💞💞 啦啦啦~这里是土土数据结构学习笔记🥳🥳 💥个人主页:大耳朵土土垚的博客 💥 所属专栏:数据结构学习笔记 💥对于数据结构顺序表链表有疑问的都可以在上面数据结…

ai直播数字人:AI大模型应用开发的神奇世界

当AI技术的发展走向一个新的高峰,AI直播数字人逐渐成为人们关注的焦点。这种全新的数字人形态,通过大模型应用开发,带来了一个神奇世界。 在这个神奇世界里,AI直播数字人可以展现出与真实人类相媲美的外貌和声音。通过先进的图像…

[递归、搜索、回溯]----递归

前言 作者:小蜗牛向前冲 专栏:小蜗牛算法之路 专栏介绍:"蜗牛之道,攀登大厂高峰,让我们携手学习算法。在这个专栏中,将涵盖动态规划、贪心算法、回溯等高阶技巧,不定期为你奉上基础数据结构…

ROS 2基础概念#6:服务(Service)| ROS 2学习笔记

服务(Service)是 ROS 2 计算图中节点通信的另一种方法。 服务基于调用和响应模型,而不是主题的发布者-订阅者模型。 虽然主题允许节点订阅数据流并获取持续更新,但服务仅在客户端专门调用时才提供数据。 ROS 2服务的基本概念 ROS…

UE4升级UE5 蓝图节点变更汇总(4.26/27-5.2/5.3)

一、删除部分 Ploygon Editing删除 Polygon Editing这个在4.26、4.27中的插件,在5.1后彻底失效。 相关的蓝图,如编辑器蓝图 Generate mapping UVs等,均失效。 如需相关功能,请改成Dynamic Mesh下的方法。 GetSupportedClass删…

微服务超大Excel文件导出方案优化

1、在导出Excel时经常会碰到文件过大,导出特别慢 2、微服务限制了请求超时时间,文件过大情况必然超时 优化思路: 1、文件过大时通过文件拆分、打包压缩zip,然后上传到oss,并设置有效期(30天过期) 2、把…

便捷在线导入:完整Axure元件库集合,让你的设计更高效!

Axure元件库包含基本的工具组件,可以使原型绘制节省大量的重复工作,保持整个设计页面的一致性和标准化,同时显得专业。Axure元件库就像我们日常生活中的门把手、自行车踏板和桌子上的螺丝钉,需要组装才能使用。作为一名成熟的产品…

搜索引擎都没流量啦,官网建设还有啥意义?

百度等搜索引擎都没啥流量了,再建设官网还有啥用?如果你把官网定位于获客,那真的没啥太大用处,但是官网不仅仅是用来获客的。 一、搜索引擎的流量被稀释了 搜索引擎流量减少的原因有多个, 1. 社交媒体的崛起&#xf…

数据库原理实验课(1)

目录 实验内容 安装头歌中的相关内容 具体过程 完结撒花~ 我也是第一次接触oracle的相关软件和操作,所以是一次傻瓜式教学记录 实验内容 安装头歌中的相关内容 具体过程 这是我在百度网盘中下载解压出来的oracle文件夹内的全部内容(可能有因为安装完…

可编程线性霍尔传感器 IC

一、产品概述 CC6521/2 是一款高性能的可编程线性霍尔传感器 IC,采用先进的 BiCMOS 制程生产,具有霍尔系数高的优点,芯片内部包含了高灵敏度 霍尔传感器,霍尔信号预放大器,高精度的霍尔温度补偿单元,振荡…

EOCR电动机保护器在冶金行业的应用具有显著的意义和优势

冶金行业是一个对电动机保护和控制设备需求非常迫切的行业,因为电动机是拖动机械的基础,广泛应用于各种动力机械中。 冶金厂中的电动机需要承受高温、高湿、高粉尘等恶劣环境,同时还需要应对频繁的启动和停止,以及电压不稳定等问…

Java中的优先队列PriorityQueue如何排序

目录 一、基本数据类型的排序 (1)升序 (2)降序 二、自定义类型如何排序 (1)升序 (2)降序 既然大家想要了解优先队列的排序,那么说明已经知道什么事优先队列了&…