【第670期】Agentopia:大语言模型长周期社会生活模拟与学习 episode artwork

EPISODE · Jul 31, 2026 · 13 MIN

【第670期】Agentopia:大语言模型长周期社会生活模拟与学习

from Seventy3

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。联系小助手微信:seventy3_podcast(加群/投稿论文)今天的这篇的主题是:Agentopia: Long-Term Life Simulation and Learning in Agent SocietiesSummary人类从社会生活中进行学习。利用大语言模型(LLM)驱动的 Agent 来模拟这一过程是一个很有前景的研究方向,由此也衍生出一个自然的问题:LLM 能否从这种模拟的社会经验中学习,从而更好地理解和复刻人类行为?然而,以往的 Agent 社会模拟通常局限在“天”的量级,限制了社会交互的深度与长期成长。在本文中,我们针对 Agent 社会中的长期生活模拟与 LLM 学习展开研究,旨在实现两个目标:(1)探索终身模拟中涌现出的社会行为;(2)通过数年的模拟社会经验,培养 LLM 的拟人化能力,特别是其在社会生活中的智能水平。具体而言,我们提出了 Agentopia,这是一个用于多 Agent 社会长期生活模拟的综合框架。在该框架中,100 个 Agent 在 10 个模拟年里自主追求个人成长、建立社会关系,并满足自身的需求与目标。我们定义了用来镜像人类幸福感(well-being)的“生活奖励”(life reward),并利用该奖励通过拒绝采样(rejection sampling)来训练 LLM。大量实验表明,Agent 表现出了丰富且涌现出的社会行为。此外,基于生活奖励的训练有效提升了底座 LLM 的能力,这不仅改善了 Agent 在模拟中的幸福感,还泛化到了下游的角色扮演基准测试中,带来了 +15.6% 的性能提升。原文链接:https://arxiv.org/abs/2606.07513前往小宇宙评论区与主播互动

Episode metadata supplied by the publisher feed · Published Jul 31, 2026

Embed this episode

NOW PLAYING

【第670期】Agentopia:大语言模型长周期社会生活模拟与学习

0:00 13:38

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of Seventy3?

This episode is 13 minutes long.

When was this Seventy3 episode published?

This episode was published on July 31, 2026.

Can I download this Seventy3 episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!