本综述全面探讨了大型语言模型(LLMs)作为自主代理和工具使用者的最新进展。研究发现,LLMs在推理、规划和记忆方面展现出类似代理的能力,并通过提示、微调和记忆增强技术进一步提升自主性能。综述分析了LLMs与外部工具的交互方式,以及当前评估方法和基准测试的局限性,并强调了未来研究方向,包括可验证推理、自改进、基础设施瓶颈、多智能体通信、上下文敏感协作、个性化不足、对抗触发器漏洞、可解释性不足和不完整的评估框架等。研究指出,专有模型如GPT-4和开源模型如LLaMA在LLM代理研究中得到广泛应用,而工具集成是使LLM代理实现自主性的关键机制。单智能体系统优先考虑自主性和内省式决策,而多智能体系统则关注协调、角色分配和协作规划。评估领域正从静态的基于准确性的基准转变为动态的过程导向方法,以更好地捕捉代理行为的多元性。未来研究应聚焦于提升代理推理的透明度和可验证性,并开发可靠的自改进方法,以构建值得信赖、富有弹性且符合领域特定要求的智能体。