可以,而且这已经是行业里正在实践的方向。比如参考资料[2]就提到,基于Agent RL的智能体训练需要在大规模并发的仿真环境沙箱中进行任务执行与环境交互,以获得高质量的策略学习数据 【2】 。
具体怎么做呢?参考资料[1]给出了一个例子:RLSandbox,提前生产题库、构建镜像,上传到容器镜像服务,然后从ACR拉取镜像发起强化学习请求,让Agent在沙箱中训练。沙箱的优势很明显:安全性高,Agent初期行为不可预测,在沙箱里犯错没损失;效率高且可复现,能快速拉起和复制环境;还能降低成本,按需使用资源 【1】 。
另外,沙箱执行正在成为AI Agent的底层基础设施标配,提供隔离、可控、可回滚的运行环境 【3】 。所以,构建沙箱生成训练数据不仅可行,而且已经是头部厂商的共识。