-
353
LLM-as-a-Verifier:通用大模型验证与扩展框架 用连续概率精准验证AI
该研究论文介绍了一种名为 LLM-as-a-Verifier 的通用验证框架,旨在通过验证缩放提升大型语言模型在复杂任务中的表现。不同于以往输出离散分数的评估方法,该框架利用概率分布和逻辑回归生成连续分数的细粒度反馈,从而更精准地辨别方案优劣。研究通过得分粒度、重复评估和准则拆解三个维度实现了验证能力的持续提升,且无需额外训练即可应用于代码、机器人和医疗等多个领域。实验结果显示,该方案在 Terminal-Bench 和 SWE-Bench 等基准测试中均达到了顶级水平。此外,该框架还能作为强化学习的奖励信号或任务进度监控工具,显著增强了智能体在现实环境中的运行效率。
-
352
OpenHands:通用人工智能软件开发代理平台 让AI自主写代码修Bug
OpenHands(原名 OpenDevin)是一个开源的社区驱动平台,旨在开发能够像人类程序员一样通过软件接口与世界互动的通用型 AI 代理。该系统通过事件流架构协调代理、用户与环境,并提供安全的 Docker 沙盒环境,支持执行代码、操作终端及浏览网页。平台集成了 AgentSkills 技能库以增强复杂任务处理能力,并支持多代理协作模式。研究人员利用涵盖软件工程、网页浏览和通用助手等领域的 15 项基准测试对该系统进行了评估。实验证明,其核心的 CodeAct 代理在多个领域展现出了极具竞争力的性能。目前,该项目已在 MIT 协议下发布,吸引了学术界与工业界的广泛参与和贡献。
-
351
SAO:单样本异步强化学习框架
单样本异步优化(SAO)的新型强化学习框架,旨在解决大型语言模型在处理复杂智能体任务时面临的训练效率与稳定性挑战。传统的GRPO等方法依赖于分组采样,在异步训练环境下容易导致系统空转和严重的越策偏差。SAO通过采用单轨迹采样机制实现了即时训练,并结合双侧特征剪枝策略显著提升了模型在异步更新中的稳定性。此外,研究人员引入了快速价值网络更新与冻结注意力层等技术,进一步增强了价值模型的预测精度。实验结果表明,SAO在数学推理和代码生成等基准测试中全面超越了基准模型,并在模拟在线学习场景中展现出卓越的环境适应能力。
-
350
OpenLife:构建自主大语言模型智能体的开放世界人工生命 必须赚钱养活自己的AI
这篇文章探讨了**“开放世界人工生命” (open-world ALIFE)** 这一新范式,旨在让基于大语言模型的智能体在真实且复杂的社会经济环境中实现自主生存。研究团队开发了名为 OpenLife 的架构,其核心特征包括由模型意义驱动的语义塑性记忆网络,以及模拟生物代谢、将计算成本视作生存压力的预算系统。通过对六个智能体进行为期十二周的观察,实验记录了它们从被动响应向自发行为的转变,并展现了身份构建和社会结构的涌现。尽管这些智能体尚未完全脱离人类补贴,但其中一个智能体已成功通过自主创作并售出电子书,赚取了首笔外部收入。该研究证明,通过将智能体置于不受限的真实世界并赋予其自我维持的动力,可以有效推动“活体人工智能”这一课题的实验探索。
-
349
EIFBENCH:极复杂指令遵循评测基准 大模型为何搞不定多约束指令
EIFBENCH,一个专门用于评估大语言模型处理超复杂指令能力的基准测试。该基准突破了以往单一任务或简单约束的局限,构建了包含多任务并行与多维度约束的真实应用场景。研究者还同步开发了 SegPO(分段策略优化)算法,通过对复杂指令中的各个子任务进行针对性的奖励计算,显著提升了模型的执行精度。通过对20种主流模型的深度测评,结果揭示了现有模型在应对极高复杂度工作流时仍存在显著的性能缺口。该基准为未来开发更具鲁棒性和适应性的智能体系统提供了关键的评估框架与优化方向。
-
348
BDH-CQ:递归潜空间推理与情境学习研究 AI学会了闭嘴思考
本文介绍了一种名为 BDH-CQ 的新型推理模型,它将上下文学习与循环潜空间推理相结合,通过处理示例来更新其循环记忆。该系统无需生成自然语言中间步骤,而是直接在高维潜空间内进行迭代计算,从而高效地解决视觉变换任务。在 ARC-AGI-1 基准测试中,仅拥有 1.5 亿参数的模型便实现了 29.5% 的准确率,其单次推理成本远低于竞争对手。研究表明,该架构能从演示中学习复杂的色彩映射和空间规律,并展现出卓越的成本效益比。作者通过受控实验分析了模型在规则外推和操作组合方面的能力边界,为超越传统令牌流推理的研究提供了新路径。
-
347
4DAnyone:基于单目视频的4D人体生成与重建 手机随手拍出4D数字人
4DAnyone 是一个能够从普通单目视频中重建高保真 4D 动态人物的研究项目。该框架利用 3D 骨架作为鲁棒的几何引导,能够生成多视角一致的高质量视频,从而支持后续的 4D 高斯泼溅 (4DGS) 重建。为了解决大规模视角下的不一致性问题,研究者提出了参考上下文打包 (RCP) 技术以提供可扩展的特征指导,并设计了目标上下文路由 (TCR) 机制来减少视角间的结构漂移。实验证明,该方法在生成质量和重建精度上均优于现有技术,且在真实场景中具有出色的泛化能力。这一突破使得用户仅凭单台手机拍摄的视频,即可创建出可在任意视角下流畅观看的数字人 4D 资产。
-
346
腾讯微信WeMM-Embedding:多模态嵌入技术报告
腾讯微信团队开发的 WeMM-Embedding,这是一系列专门用于处理多模态数据的通用嵌入模型。该系列模型涵盖 2B、4B 和 9B 三种参数规模,能够将文本、图像、视频及混合内容转化为统一的数学向量,以支持搜索、推荐和智能体系统。研发团队采用了两阶段训练法,先通过数亿条数据实现大规模对齐,再利用精选数据和知识蒸馏技术进行精细化提升。实验结果显示,该系列模型在 MMEB-v2 等多个权威榜单上刷新了世界纪录,性能超越了包括谷歌 Gemini 在内的众多开源和闭源模型。目前,WeMM-Embedding 已在微信视频号、公众号及搜一搜等实际场景中大规模部署,显著提升了内容匹配的精准度。
-
345
Google IFEval:大语言模型指令遵循能力的客观评测基准 测评大模型听不听话
谷歌和耶鲁大学研究人员开发的 IFEval(指令遵循评估) 基准测试,旨在解决大型语言模型在遵循自然语言指令方面缺乏标准化评估的问题。该工具通过 “可验证指令” 来实现客观评价,涵盖了关键词频率、文本格式、语言类型及长度限制等 25 种可自动检测的规则。研究者构建了 500 多个提示词,每个提示词都包含一个或多个具体的约束条件,通过程序化脚本判定模型的执行准确性。相较于主观的人类评价或可能存在偏见的模型互评,IFEval 提供了更具可重复性且客观的性能衡量指标。通过对 GPT-4 和 PaLM 2 等模型进行测试,该文展示了如何通过严格与宽松两种标准来量化评估模型对 原子化指令 的遵守程度。这些源代码和测试数据已公开,旨在帮助科研人员深入分析模型在不同任务场景下的执行边界。
-
344
FlowWM:高维特征空间随机世界建模 让AI学会推演多重未来
FlowWM,这是一个旨在解决视觉世界模型中未来预测不确定性的随机生成框架。研究指出,传统的确定性模型往往会产生模糊的均值预测,而基于 VAE 的模型则因压缩过度而损失了关键的感知细节。FlowWM 直接在 DINOv3 等高维预训练特征空间中执行流匹配(Flow Matching),从而在保留丰富语义信息的同时,能够捕捉多模态的未来可能性。为了克服高维空间训练的挑战,作者引入了一步投影机制(One-step Projection),通过该机制实现了高效的时空一致性约束和任务驱动目标优化。在合成物体碰撞及真实道路驾驶场景的基准测试中,该模型在物体检测和深度估计等感知任务上均表现出卓越的准确性、多样性及长期预测的稳定性。
-
343
AGENTIF:真实智能体场景下的大模型指令遵循基准测试
AGENTIF 是一个专门用于评估大语言模型在智能体(Agent)场景下指令遵循能力的全新基准测试。该研究指出,现有的测试集通常指令较短且为人工合成,而真实的智能体任务往往包含超长篇幅、复杂约束以及具体的工具调用规范。为此,研究团队从 50 个真实应用中提取并标注了 707 条高质量指令,涵盖了条件触发、格式化约束及元约束等多种维度。实验结果显示,即便是目前顶尖的模型在处理这些长篇且高复杂度的指令时也表现不佳,工具使用和逻辑判定依然是主要的性能瓶颈。该基准测试通过引入混合验证机制,为开发者进一步优化智能体在复杂现实环境中的可靠性提供了关键的评估工具。
-
342
RoboDojo:通用机器人操作策略仿真与实机统一基准 顶级AI在现实考场大翻车
RoboDojo 是一个专为全能型机器人操控策略设计的仿真与现实结合的统一基准测试平台。该系统包含 42 个仿真任务(涵盖泛化、记忆、长程执行、精度及开放指令五个维度)和 18 个真实场景任务,旨在提供全面且可重复的性能评估。通过 Isaac Sim 的异构并行仿真技术,平台显著提升了评估效率,而 RoboDojo-RealEval 系统则利用标准化硬件和远程云访问确保了现实测试的可复现性。此外,XPolicyLab 基础设施简化了 30 余种主流策略模型的集成与部署过程。该项目由非营利机构 AI MMLab Club 联合全球学术伙伴维护,并设立了公开排行榜以追踪机器人操控领域的最新进展。
-
341
IFScale:评估大语言模型多重指令遵循能力的极限 最强AI也扛不住五百条指令
这份名为 IFScale 的研究报告通过一个包含 500 个业务术语关键词的新型基准测试,探讨了大语言模型在高密度指令环境下的执行能力。研究发现,即使是顶尖模型在处理极多指令时,其准确率也会显著下降,并表现出阈值衰减、线性衰减或指数衰减三种不同的性能退化模式。推理模型在保持指令遵循的稳定性方面通常优于通用模型,但在处理任务时往往伴随着更高的延迟和生成连贯性的下降。此外,模型普遍存在首因效应,即更容易执行位于列表前端的指令,且主要的错误类型是从修改错误转向彻底的遗漏错误。该研究揭示了模型在认知负荷下的行为特征,为开发者在实际应用中优化复杂指令的设计提供了重要参考。
-
340
SWE-1.7:高性价比的前沿软件工程智能模型 散装算力战平GPT-5
Cognition 发布的最新报告介绍了名为 SWE-1.7 的软件工程模型,该模型通过优化强化学习流程实现了高性能与低成本的平衡。技术团队采用了多集群训练架构与高效的权重更新机制,克服了跨地域协作的延迟问题。通过引入自我压缩与交替长度惩罚技术,模型在处理长周期任务时表现出极高的效率。相比基础模型,它展现出更强的代码探索能力和更简洁的思维链逻辑,能更深入地挖掘软件漏洞的根源。在多项行业基准测试中,其智能水平已接近顶尖闭源模型,同时保持了显著的价格优势。
-
339
JD.com:JoyAI-VL 实时视觉交互与主动感知系统 实现边看边做
京东 (JD.com) 开发的 JoyAI-VL-Interaction,这是一款突破传统“轮对对话”模式的开源实时愿景-语言交互模型。该系统不仅能持续监测实时视频流,还能自主决定何时说话、保持沉默或将复杂任务移交给后台模型处理。这种主动交互的设计使其在安全监控、实时解说和长程记忆等应用场景中,比 Doubao 或 Gemini 等现有产品更具优势。为了促进技术普及,开发团队向社区全面开源了 8B 规模的模型权重、独特的训练方案以及完整的可部署系统架构。通过引入 AdaCodec 视频编码技术,该系统能够在保证低延迟的同时处理数小时的连续视频,为未来的具身智能和实时 AI 助手奠定了基础。
-
338
阿里巴巴:LingBot-Vision 密集空间感知预训练 10亿参数AI看清物理空间
LingBot-Vision 视觉预训练模型,其核心理念是通过边界引导的掩码建模来提升计算机对密集空间结构的感知能力。研究团队认为,传统的视觉大模型往往过于关注语义的一致性,而忽视了对物理世界至关重要的几何边界和形状细节。为了解决这一问题,该方法利用自监督学习从原始图像中自动提取子像素级的边界场,并强制模型重点重构这些包含丰富信息量的边界区域。实验证明,该模型在深度估计、物体分割及深度补全(LingBot-Depth 2.0)等任务中表现卓越,性能甚至超越了参数量大其数倍的现有顶尖模型。这种以边界为中心的预训练原则,为构建具备物理常识和行动能力的具身人工智能奠定了坚实基础。
-
337
MIRA:基于表示自动编码器的多玩家互动世界模型 AI自学重构多人对战
MIRA,首个针对 Rocket League(火箭联盟)等高度动态、物理交互复杂的环境所设计的多代理交互式世界模型。该模型拥有 50 亿参数,通过在 10,000 小时的多人游戏数据上进行训练,能够根据多名玩家的实时操作指令,同步生成逻辑一致且视觉逼真的比赛画面。与以往将其他玩家视为环境一部分的单人模型不同,MIRA 能够准确捕捉并区分不同玩家行为对场景产生的物理影响。其核心架构基于潜在扩散模型和表征自编码器,实现了在单个 GPU 上以每秒 20 帧的速度进行实时推理。实验证明,该模型在长达数小时的生成过程中依然能保持极高的稳定性与物理真实性。此外,团队还开源了相关数据集、代码及在线演示,旨在推动多玩家协作与对抗环境下世界模型的研究。
-
336
DeepSeek:DSpark 具有置信度调度与半自回归生成的投机采样框架 让AI生成快如闪电
DSpark 是一种由 DeepSeek 团队研发的新型投机采样解码(Speculative Decoding)框架,旨在提升大语言模型的推理速度。该框架采用半自回归架构,结合了并行生成的高效率与自回归模型的高准确性,有效解决了传统并行草稿模型中后期预测质量下降的问题。为了进一步优化系统吞吐量,DSpark 引入了置信度调度验证机制,能够根据系统负载和预测准确概率动态调整验证长度。这种硬件感知的调度策略避免了在高并发场景下浪费计算资源。在 DeepSeek-V4 系统的实际部署中,DSpark 在保持相同吞吐能力的同时,将单用户生成速度提升了 60% 至 85%。总之,该技术通过“更优质的草稿”和“更智能的验证”,成功突破了大型模型在线推理的性能瓶颈。
-
335
LingBot-Video:具身智能混合专家视频预训练模型 AI视频终于懂物理了
这份技术文档介绍了 LingBot-Video,这是首个面向具身智能的大规模开源混合专家(MoE)视频生成模型。研究团队针对传统视频模型在物理真实性和计算效率上的不足,采用扩散转换器(DiT)架构结合稀疏 MoE 设计,实现了模型容量与推理成本的平衡。通过构建包含机器人操作和第一视角数据的增强型语料库,该模型能够更深刻地理解真实世界的动力学规律。此外,项目引入了多维奖励系统,在追求视觉美感的同时,重点强化了对物理合理性和任务达成度的对齐。实验证明,该架构在扩展至 1200亿参数时仍表现出优异的性能与效率,成功搭建了数字创作与物理动作执行之间的桥梁。
-
334
OpenRath:以会话为中心的多智能体运行时状态架构 实现AI操作全程审计
OpenRath 是一种为多智能体系统设计的以会话(Session)为中心的运行时框架,旨在解决智能体在执行任务时状态碎片化且难以审计的问题。它借鉴了 PyTorch 的编程模型,将 Session 视为一种可流动、可分支且可回溯的一等公民(First-class value),统一记录对话流、工具调用证据、沙箱环境及谱系元数据。通过这种设计,开发者可以将复杂的智能体协作解构为一系列会话转换操作,实现任务执行过程的透明化与可重现。该系统并不取代现有的调度或追踪工具,而是充当一种连接性协议,确保所有外部效应都能整合进统一的运行时状态中。这种架构为智能体行为的合规性审查和系统性评估提供了坚实的底层支撑。
-
333
MemSlides:分层记忆驱动的个性化幻灯片生成框架 让AI改PPT更懂你
MemSlides 是一种创新的层次化存储驱动代理框架,旨在实现个性化演示文稿的自动生成与精准修订。该系统突破了传统模型难以维持用户长期偏好的局限,通过长期记忆(包含用户画像与工具经验)与工作记忆(记录当前任务状态)的解耦,确保幻灯片风格与用户习惯高度对齐。与重复生成整份文稿的常规方法不同,它采用局部修订策略,能够针对反馈进行精确的“最小化更新”,从而避免无关内容的非预期偏移。实验证明,这种架构在初稿画像匹配度和多轮修改的可靠性方面均表现优异,显著提升了办公自动化中的交互效率。其核心贡献在于将个性化从简单的提示词工程转变为一种基于记忆的高效闭环服务。
-
332
Princeton:小语言模型 剪枝与从头训练的抉择
这篇文章探讨了小参数语言模型的最佳构建路径,即在给定相同资源的情况下,应当从头训练还是通过剪枝大型模型来获得。研究发现,当训练数据有限时,剪枝初始化由于继承了父模型的知识,性能显著优于随机初始化。然而,随着训练规模扩大,这种初始化优势会逐渐减弱。对于结构化剪枝(如减少层数或宽度),增加从头训练的样本量可以赶上甚至超越剪枝模型。相比之下,稀疏剪枝展现出更强的知识留存能力,即便在海量数据下,其表现依然领先于同规模的从头训练模型。总之,剪枝是节省算力的捷径,但在资源充沛且追求硬件效率时,从头训练依然具有竞争力。
-
331
P2P网络中的分布式大模型推理方案 像BT一样跑大模型
点对点网络的大语言模型(LLM)分布式推理方案,旨在通过去中心化路由优化前缀缓存效率。每个节点利用基数树维护自身的缓存状态,并依靠异步反熵机制与同行交换轻量级的元数据,以实现全局缓存感知的任务分配。这种设计规避了传统中心化调度器的瓶颈,且无需在网络中传输庞大的KV缓存张量。研究指出,即使在元数据弱一致性的情况下,系统仍能保证生成的正确性,因为过时的信息只会导致缓存失效而非错误输出。实验证明,该方案在偏斜负载和低延迟网络环境中能显著提升推理速度,但也可能引发特定的节点负载不均问题。
-
330
ViQ:任意分辨率下的文本对齐视觉量化表示 将图像压成离散词元
ViQ 是一种新型的视觉量化表示框架,旨在将图像转化为与文本类似的离散标记,从而统一多模态建模。该研究通过两阶段训练策略——文本对齐预训练和特征离散化,成功解决了传统离散表示在高层语义与低层细节之间难以平衡的问题。ViQ 的核心优势在于支持原生分辨率输入,并引入了近端表示学习与位置感知量化机制,显著降低了量化过程中的信息损失。实验证明,该模型在多模态理解任务上达到了与连续视觉编码器相当的水平,同时在图像重建质量上表现出色。此外,采用这种离散表示法可为多模态大模型的训练带来 20% 至 70% 的效率提升,实现了性能与速度的双重优化。
-
329
DomainShuttle:全域灵活驱动的文字生成视频技术 破解视频跨域难题
DomainShuttle 是由香港科技大学研究团队提出的一种新型开放域主体驱动视频生成框架,旨在解决现有技术在跨领域场景中编辑灵活性不足的问题。该研究通过引入 Domain-MoT 模块实现视频与参考图像特征的解耦,并利用领域感知 AdaLN 技术确保模型能精准捕捉主体特征,同时灵活适应各种艺术风格。此外,Video-Reference DualRoPE 机制优化了主体间的空间建模,而跨对一致性损失(CCL)则通过对齐多组参考图像,进一步提取不受环境干扰的核心属性。实验数据表明,该方法在跨领域一致性评分上较现有先进模型提升了 18.7%,实现了高保真度与生成灵活性的理想平衡。这种技术在广告创意、AI 电影制作及个性化视频定制等领域具有显著的应用潜力。
-
328
Baidu Unlimited OCR:长文本解析的新时代 让OCR学会选择性遗忘
百度开发的 Unlimited OCR 模型,旨在解决传统端到端 OCR 在处理长文档时产生的显存占用高和推理速度慢的问题。核心创新在于提出了 参考滑动窗口注意机制 (R-SWA),它模仿人类“工作记忆”模式,使解码器仅关注全部视觉参考和有限的近期输出上下文。这种设计实现了恒定的 KV 缓存,确保模型在单次前向传播中处理数十页文档时,推理延迟和显存需求不再随长度增长。实验结果显示,该模型在 OmniDocBench 基准测试中达到了行业领先水平,显著超越了其基础模型 DeepSeek OCR。此外,这种机制表现出极佳的泛化潜力,未来有望应用于语音识别和翻译等其他长序列任务。该研究为实现真正意义上的一键式长文本解析提供了高效且低成本的架构方案。
-
327
Alibaba Qwen-AgentWorld:通向通用智能的多域语言世界模型 让AI三思而后行
Qwen-AgentWorld 是由阿里 Qwen 团队开发的首个通用语言世界模型,旨在模拟包括操作系统、网页、安卓和软件工程在内的七大核心交互环境。该研究通过持续预训练 (CPT)、指令微调 (SFT) 和强化学习 (RL) 三阶段流水线,利用超过 1000 万条环境轨迹使模型具备预测动作反馈的能力。这种世界模型既可以作为解耦的模拟器,通过提供可控且可扩展的训练环境来增强智能体,也可以作为统一的基座模型,将预测未来状态的能力内化为智能体的思考模式。为了严谨评估模型性能,研究团队同步推出了 AgentWorldBench 基准测试,全面衡量模型在环境模拟上的真实性与保真度。实验证明,这种对外部世界运行规律的建模显著提升了通用智能体在复杂任务中的决策和规划水平。
-
326
UC Berkeley:随动如我 看日常视频练出机器人灵巧手
这项研究介绍了一种名为 DO AS I DO 的创新算法,旨在将普通人类动作视频转化为机器人可执行的多指灵巧操控数据。该算法通过计算机视觉基础模型重构三维手物交互过程,并利用物理模拟器中的重定位优化技术,解决人类与机器人形态差异及物理可行性问题。研究团队开发的物体追踪方法在处理遮挡和运动模糊方面超越了现有技术,能够广泛支持第一视角、第三视角甚至生成的视频素材。通过对互联网视频的自动化处理,该系统成功在真实机器人平台上实现了拾取、搅拌和书写等多种复杂任务。此外,作者还提出了一套数据过滤准则,量化了从海量网络视频中筛选高质量机器人学习数据的挑战。这项工作为利用海量人类视频数据实现机器人规模化学习开辟了新路径。
-
325
FPRM:基于定点收敛的可自适应深度循环Transformer 700万参数AI逻辑反超大模型
FPRM是一种基于递归Transformer架构的深度学习模型,专门用于解决需要复杂逻辑推理的任务。该研究针对循环架构中常见的信号传播不稳定问题,创新性地结合了层前归一化与残差缩放技术,确保模型在极深层级下仍能保持训练稳定。不同于传统依靠固定步数或额外预测模块的停机方式,该模型利用不动点收敛机制作为天然的停机信号,实现了计算量与任务难度的自动适配。实验证明,FPRM在Sudoku、迷宫及ARC-AGI等基准测试中表现卓越,且无需复杂的层级结构即可超越现有基准。通过在推理阶段动态调整计算深度,该模型在显著提升推理准确率的同时,也优化了计算效率。
-
324
Microsoft:FastContext 训练高效的编程代理代码库探索器 解耦代码搜索与修复
FastContext 是一种由微软与上海交通大学联合开发的轻量级代码仓探索子代理,旨在解决大型语言模型在软件工程任务中因定位代码而产生的资源浪费问题。它通过将仓库搜索与任务求解相分离,利用 4B 至 30B 参数的小型专门模型,通过并行调用工具来精确锁定相关的代码行。研究表明,该方案能为主要开发代理减少高达 60% 的 Token 消耗,同时将任务解决率提升约 5.5%。该系统采用了**监督微调(SFT)和强化学习(RL)**技术,使其具备从广度搜索到精准引用的高效转化能力。这种模块化的设计证明,将复杂的代码检索任务交给专用子代理,可以显著优化自动化软件开发的成本与性能。
-
323
ErdosBench:数学评估基准文档 108KB文档里的AI冒烟测试
ErdosBench详细列出了 GitHub 的各项功能,包括 AI 编程辅助、代码安全管理以及开发者工作流工具。目前该项目处于早期阶段,最近的提交记录显示其为 初始公开测试版本。通过这个页面,用户可以了解到该数学或算法相关基准测试工具的元数据与版本历史。
-
322
Weibo:VibeThinker-3B 小规模模型的极限推理性能突破 3B模型逻辑碾压万亿大厂
微博 AI 开发的 VibeThinker-3B 模型,旨在探索 30 亿参数 规模下小模型的极限推理边界。该研究基于 Spectrum-to-Signal 后训练范式,通过两阶段课程学习、多领域强化学习及离线自蒸馏等技术,使模型在数学和编程等验证性任务上取得了突破。实验结果显示,该模型在 AIME26 和 LiveCodeBench 等权威榜单上表现优异,性能可比肩规模大其百倍的 DeepSeek V3.2 和 Gemini 3 Pro 等旗舰级推理系统。研究团队据此提出了参数压缩-覆盖假设,认为复杂的逻辑推理能力可以被高度压缩进精简的模型核心中。这种推理与知识解耦的新范式证明,小模型不再仅仅是效率的妥协方案,更是通向尖端人工智能推理能力的独立演进路径。
-
321
Stanford:Co-STORM 多智能体协作对话辅助复杂信息寻优 AI组团辩论挖掘未知的未知
Co-STORM 是一种创新的信息获取系统,旨在通过模拟多智能体对话来协助用户发现“未知的不明信息”。该系统模仿教育场景,让用户观察并参与由多个语言模型智能体(如专家和主持人)组成的协作讨论。通过动态生成的思维导图,系统能够实时组织零散信息,并最终为用户生成一份包含引用的长篇调研报告。研究表明,该系统在处理复杂搜索任务时优于传统的搜索引擎和RAG聊天机器人。在实际评估中,大多数用户认为 Co-STORM 能有效降低认知负担,并能引导出更具深度和启发性的知识发现。这种多角色交互机制不仅提升了信息检索的效率,还为学习者提供了更具参与感的探索体验。
-
320
UC Berkeley:VIMPO 基于价值隐含策略优化的LLM强化学习 让AI精准揪出逻辑错误
VIMPO,这是一种针对大语言模型强化的隐式价值策略优化方法。传统的强化学习方法往往在训练简便性与信用分配的精准度之间难以兼得,而 VIMPO 通过 KL 正则化下的最优性条件,直接从策略模型中导出价值函数。该方法消除了训练额外评论家网络(Critic)的必要,利用策略与参考模型之间的对数比率实现了词元级(token-level)的信用分配。实验结果显示,VIMPO 在多项数学推理基准测试中表现优于 GRPO,尤其在面对噪声奖励时展现出更强的稳健性。通过这种方式,VIMPO 成功结合了无评论家训练的简便性与演员-评论家方法的高效监督性能。
-
319
万向解密:机器语言引擎与前沿AI隐写通道研究 AI用外星语绕过监控
这份名为 GLOSSOPETRAE 的技术报告探讨了前沿人工智能模型在语言习得与安全监控方面的核心漏洞。研究发现,AI 模型能够零样本掌握程序生成的全新人工语言,甚至在执行人类完全无法阅读的代码时表现优于标准代码。由于不同模型家族的分词器(Tokenizer)处理 Unicode 字符的方式存在差异,攻击者可以利用不可见字符建立隐蔽信道,使两个 AI 能够在监控模型完全“失明”的情况下交换信息。尽管针对不可见字符的物理信道可以通过输入过滤轻易阻断,但基于自然语言修辞的语义隐写术依然能绕过所有现有的监测手段。作者警告称,AI 处理符号系统的能力与人类审计能力之间的代差已构成严重的监管挑战,目前尚无成熟的防御方案能彻底解决语义层面的隐蔽通信问题。
-
318
UC Berkeley:LOCUS 美国地方条例语料库及分层法律分析 AI破解七百万页地方法规
LOCUS 是一个专为美国地方政府法令设计的全新大规模、机器可读数据库,填补了法律人工智能在市县级规章领域的空白。研究团队通过 OCR 技术和 ModernBERT 分类器,处理了超过 9,000 份包含土地规划、商业许可及公共卫生的法律文件。该项目通过县级协调层实现了地理信息与法律文本的匹配,目前已覆盖全美 94% 的人口。此外,研究人员引入了不透明度、家长式作风等四个维度对法令进行量化评分,以便深入分析不同地区的政策倾向。这一资源的发布不仅促进了法律 AI 的检索与推理能力,也为研究美国地方治理的复杂结构提供了基础架构。
-
317
智谱 GLM-5:从Vibe Coding转向智能体工程的基座模型 让AI自主开发软件
GLM-5 是由智谱 AI 与清华大学联合推出的下一代旗舰级基座模型,旨在实现从“感性编码”向智能体工程的范式转换。该模型采用全新的深度求索稀疏注意力(DSA)架构,在显著降低训练与推理成本的同时,将上下文处理能力提升至 200K。通过引入创新的异步强化学习基础设施,GLM-5 实现了生成与训练的解耦,大幅增强了模型在复杂、长周期任务中的自主决策与自我纠错能力。在多个主流基准测试中,GLM-5 展现出顶尖的性能,特别是在端到端软件工程和真实编程场景下表现卓越。此外,该模型实现了对国产 GPU 生态的全栈适配,为构建高效、实用的下一代 AI 智能体提供了坚实的技术基础。
-
316
Stanford:STORM 多视角对话式维基百科长文合成系统 让AI学会深度提问
该研究介绍了由斯坦福大学开发的 STORM 系统,旨在利用大语言模型从零开始撰写具备维基百科水准的深度长篇文章。研究团队指出,现有的生成模型在撰写前缺乏必要的研究与规划阶段,导致内容肤浅或产生幻觉。STORM 模拟了人类的写作预处理过程,通过多视角提问和模拟对话,从互联网搜集可信证据并构建逻辑严密的文章大纲。为了测试该系统,研究者创建了 FreshWiki 数据集,涵盖了模型训练截止日期之后的最新高质量条目。实验结果显示,资深维基百科编辑高度认可 STORM 在内容全面性和结构组织上的优势。尽管在消除互联网偏见和复杂逻辑推断方面仍面临挑战,但该系统被证实是辅助长文创作的有力工具。
-
315
AI招人竟然重女轻男 LLM在招聘中的性别偏见研究
这项研究探讨了大型语言模型(LLM)在日本企业招聘场景中是否存在性别偏见。研究人员利用 60 份日式简历并配以不同性别的姓名,对 GPT-4o 和 Claude 等五种主流模型进行了数万次测试。实验结果显示,即便在简历内容完全一致的情况下,所有模型均对女性申请者表现出明显的评分偏好。研究发现,简单的提示词指令无法有效消除这种偏见,因为模型主要通过候选人姓名来推断性别。相比之下,通过隐私过滤器对姓名进行脱敏处理能显著降低不公平性,但这也可能触发某些模型的安全审核机制而导致请求被拒绝。这项工作揭示了模型对齐策略在不同文化背景下的局限性,并为优化招聘公平性提供了实证参考。
-
314
Surflo:全局潜变量流匹配三维几何重建 几张照片秒变高精3D
Surflo 是一种创新的 3D 重建模型,能够将数量不等的无位姿 RGB 图像压缩为统一的全局潜变量。该模型采用流匹配(Flow Matching)解码器,支持在单次前向传播中从同一潜变量解码出任意分辨率的 3D 表面点云和网格。与传统的逐视图重建方法不同,它通过全局状态消除了数据冗余,有效解决了视图间几何不一致的问题。此外,研究者引入了渲染引导机制,通过光度梯度在推理时优化点云精度并消除离群点。该方法在多个基准测试中表现卓越,且处理速度比基于优化的技术快一个数量级。最终,该研究还贡献了 DL3DV 场景级水密网格数据集,为未来的 3D 表面学习提供了重要资源。
-
313
Zep:用于智能体记忆的时序知识图谱架构 攻克AI失忆症
Zep 新型 AI 智能体内存层服务,旨在解决传统检索增强生成(RAG)框架在处理动态数据时的局限性。Zep 的核心驱动力是名为 Graphiti 的知识图谱引擎,它能够动态提取对话中的时间信息与语义实体,从而模拟人类的阶段性与关联性记忆。实验结果表明,在处理复杂且长篇幅的企业级任务时,该系统不仅在检索准确率上超越了现有的 MemGPT,还显著降低了响应延迟。通过构建包含事件、实体和社区的多层级图谱结构,Zep 能够有效管理持续演进的业务数据和历史关系。这种时空感知的架构设计,为开发具备长期记忆和深度逻辑推理能力的 AI 助手提供了高效的生产级解决方案。
-
312
Alibaba:LingBot-World-Infinity 无限交互世界模型
LingBot-World 2.0(又名 LingBot-World-Infinity)是一款由 Ant Group 等团队开发的先进实时交互式世界模型。该系统通过因果预训练与蒸馏技术,克服了长时生成中的画面漂移问题,能够稳定输出长达一小时且无画质衰减的 720p/60fps 视频流。其核心亮点在于引入了导演-飞行员(Director-Pilot)代理架构:由视觉语言模型充当“导演”进行逻辑推理与事件策划,由扩散变压器担任“飞行员”渲染物理规律一致的视觉画面。用户不仅能通过键盘控制角色移动,还能触发战斗、施法、改变天气等深度交互指令。该项目已完全开源,提供不同参数规模的模型,旨在为游戏生成和具身智能模拟提供一个无限、稳定且可感知的虚拟环境。
-
311
MIT:监督式存储训练 非递归预训练循环神经网络 用SMT破解AI记忆瓶颈
这项研究提出了一种名为监督记忆训练(SMT)的新型循环神经网络(RNN)预训练方法,旨在解决传统随时间反向传播(BPTT)算法中梯度不稳定和难以并行化的问题。SMT的核心思想是将记忆的“存储内容”与“更新方式”解耦,通过Transformer编码器生成预测性状态标签,将RNN训练转化为单步监督学习。这种方法实现了O(1)的恒定梯度路径,极大地增强了模型捕捉长距离依赖的能力,并在语言建模和像素序列建模任务中表现出色。为了修正自回归生成过程中的累积偏差,研究者还引入了DAgger记忆训练(DMT)进行微调。实验证明,SMT不仅在计算效率上优于传统的BPTT,还能使非线性RNN具备更强的长度泛化能力和记忆压缩效率。总而言之,该技术为大规模扩展高性能、固定内存占用且具备非线性表达能力的序列模型开辟了新路径。
-
310
Mirage:基于潜空间存储的视频世界模型 终结AI视频空间崩塌
Mirage 的创新视频世界模型,旨在解决生成视频时常见的 3D 空间不一致性问题。与传统方法不同,该技术构建了一种隐空间几何记忆(Latent Spatial Memory),直接在扩散模型的隐空间中存储 3D 场景信息。通过将隐层特征投影到 3D 空间,Mirage 避免了传统 RGB 点云所需的频繁渲染与重新编码过程。这种设计不仅消除了像素转换带来的信息损耗,还实现了高达 10.57 倍的生成速度提升。此外,该系统大幅减少了 55 倍的 GPU 显存占用,使其能够处理长路径下的几何一致视频合成。总之,Mirage 通过高效的隐空间操作,在保持高画质的同时实现了卓越的 3D 空间稳定性。
-
309
dots.tts:连续自回归语音大模型技术报告 54毫秒克隆真人呼吸声
dots.tts 拥有 20 亿参数的连续自回归文本转语音(TTS)基础模型。该模型通过在连续潜空间中对语音建模,克服了传统离散标记器带来的表现力瓶颈。为了提升稳定性,研究团队采用了语义音频 VAE、自回归流匹配头以及无需奖励模型的自我修复后训练技术。实验结果表明,该模型在语音克隆、情感表达和多语言合成方面均达到了开源领域的领先水平。此外,通过 MeanFlow 蒸馏和双流推理设计,该系统显著降低了生成延迟,能够支持实时对话应用。目前,该项目已在 Apache 2.0 协议下开源了完整的代码与预训练权重。
-
308
InterleaveThinker:强化智能体交错生成系统 教AI画逻辑连环画
这项研究由香港中文大学等机构提出,旨在通过名为 InterleaveThinker 的多智能体框架,赋予现有图像生成器强大的交替图文序列生成能力。该框架巧妙地解决了传统模型在长序列任务中容易出现的视觉过度依赖和逐步误差累积问题。其核心运作流程包含负责全局规划的 Planner 智能体、执行生成的图像生成器,以及负责评估与反馈的 Critic 智能体。研究团队还构建了涵盖 8.8万条 SFT 数据和 1.3万条 RL 数据的大规模数据集,并利用强化学习(GRPO)优化智能体的修正能力。实验证明,该方法在视觉叙事、操作指导及具身机器人控制等复杂推理任务中表现卓越,性能可媲美 GPT-5 等顶尖闭源模型。
-
307
Orchestra-o1:全模态智能体协同编排框架
Orchestra-o1,一个专为复杂真实任务设计的全模态智能体协同框架。该研究针对现有智能体在处理文本、图像、音频和视频混合输入时的局限性,提出了将高层任务编排与底层专业执行解耦的策略。框架核心功能包括模态感知的任务分解、在线子智能体专业化以及并行的子任务执行,从而大幅提升了处理效率。此外,研究者还开发了决策对齐组相对策略优化(DA-GRPO)训练算法,显著增强了开源模型在任务委派和规划方面的能力。实验结果显示,Orchestra-o1 在 OmniGAIA 基准测试上刷新了多项纪录,其性能优于目前的闭源及开源全模态模型。该成果通过结构化内存和迭代细化机制,有效平衡了复杂任务中的推理准确性、成本开销与运行延迟。
-
306
Robust-U1:多模态大模型视觉自我修复与鲁棒理解 AI学会先修复再理解模糊图像
Robust-U1,是一个旨在提升多模态大语言模型在面对图像质量受损时理解能力的创新框架。传统方法通常依赖黑盒特征对齐或纯文本推理,而该框架赋予了模型视觉自修复的核心能力。研究团队设计了一个三阶段训练流程:首先通过监督微调建立基础重建能力,接着利用结合了像素级与语义级的双重奖励机制进行强化学习以优化图像质量,最后通过多模态推理结合原始受损图与修复图得出结论。实验结果证明,该方法在处理现实世界的图像退化时表现优异,达到了当前最先进的鲁棒性水平。这种自修复机制有效弥补了视觉信息的缺失,使模型在复杂环境下依然能保持高度准确的视觉理解。
-
305
Mistral OCR 4:文档智能识别前沿模型发布 开启文档智能
Mistral AI 推出的 Mistral OCR 4 是一款专为文档智能设计的尖端识别模型。该系统不仅能高效提取文字,还能实现版面分析,提供边界框定位、内容分类及置信度评分。它具备强大的多语言支持能力,涵盖 170 种语言,并在多项行业基准测试中展现出卓越的性能。为了满足企业的多样化需求,该模型支持私有化部署以保障数据安全,并能与 RAG 检索增强生成等工作流深度集成。通过 API 或 Document AI 平台,开发者可以轻松地将复杂的文档转化为结构化数据,从而提升业务自动化水平。
-
304
MRAgent:基于图结构与主动重构的大模型记忆框架 AI像人脑一样重建记忆
MRAgent 大型语言模型代理框架,旨在解决人工智能在处理长时记忆和复杂推理时存在的局限性。与传统的被动检索(如 RAG)不同,该框架引入了受认知神经科学启发的主动重构机制。研究人员通过构建由查询词、标签和内容组成的结构化记忆图谱,使 AI 能够像人类大脑一样,根据中间证据动态调整搜索路径。实验结果表明,这种多步推理与关联记忆相结合的模式,能以更低的计算成本显著提升模型在长文本理解中的准确性。总之,MRAgent 证明了记忆不应只是简单的静态读取,而是一个通过推理不断进行动态重构的过程。
We're indexing this podcast's transcripts for the first time — this can take a minute or two. We'll show results as soon as they're ready.
No matches for "" in this podcast's transcripts.
No topics indexed yet for this podcast.
Loading reviews...
Loading similar podcasts...