ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

具身世界模型入门第一课:用Every-Embodied的扩散模型、VAE与DDPM代码快速吃透数理基础

具身世界模型入门第一课:用Every-Embodied的扩散模型、VAE与DDPM代码快速吃透数理基础 具身世界模型入门第一课用Every-Embodied的扩散模型、VAE与DDPM代码快速吃透数理基础【免费下载链接】every-embodied仅需Python基础从0构建自己的具身智能机器人从0逐步构建VLA/OpenVLA/SmolVLA/Pi0 深入理解具身智能项目地址: https://gitcode.com/gh_mirrors/ev/every-embodied具身世界模型是具身智能Embodied AI当前最热的研究方向之一它让机器人学会预测未来为VLA策略和数据合成打下地基。开源项目Every-Embodied仅需 Python 基础从 0 构建自己的具身智能机器人在17-具身世界模型章节中提供了一条极其友好的学习路线先建立扩散模型的数理基础再用三套由浅入深的代码——VAE与DDPM的可运行实现——把从噪声生成数据这件事彻底讲透。本文带你走完这条入门路径。什么是具身世界模型为什么从扩散模型学起传统机器人策略是看一张图出一个动作而世界模型更进一步它学习环境会如何随时间演化能预测如果我这样做下一帧画面/状态会是什么。这正是 VLA 大模型、仿真数据合成、自我改进策略如 RISE、GE-Sim-V2共同依赖的底层能力。而几乎所有世界模型的生成引擎都是扩散模型Diffusion Model。想要吃透它必须先掌握 VAE 和 DDPM 的数理基础——这正是 Every-Embodied 教程开篇就安排好的内容章节内容难度1、扩散数理基础及问题解析入门贝叶斯公式、Jensen 不等式、高斯分布、KL 散度 圆环生成小实验⭐ 入门2、VAE详解与代码实现ELBO 推导 MNIST 图像生成完整代码⭐⭐3、DDPM详解与代码实现前向加噪/反向去噪完整推导 STL10 训练采样闭环⭐⭐⭐扩散模型数理基础速览4个关键工具很多人被扩散模型的一堆公式吓退其实只需要 4 个数学工具就能读懂后续所有推导详见 扩散数理基础及问题解析入门.md贝叶斯公式后验 似然 × 先验 ÷ 证据。它回答看到结果后反推最可能的原因DDPM 的真实后验推导全靠它。Jensen 不等式对凹函数 $\log$有 $\log\mathbb{E}[X] \ge \mathbb{E}[\log X]$。它是构造ELBO证据下界的关键一步——把不可解的似然变成可优化的下界。高斯分布生成模型里最常用的分布。一维写作 $x \sim \mathcal{N}(\mu, \sigma^2)$多维写作 $x \sim \mathcal{N}(\mu, \Sigma)$VAE 和 DDPM 都建立在每一步都是高斯的假设上。KL 散度衡量两个分布的距离越小越好为 0 表示完全相同。VAE 训练 loss 里的 KL 项、DDPM 的均值匹配损失本质都是最小化 KL 散度。 建议不需要手推所有公式重点记住每个工具解决什么问题后面的代码会自然对应上。圆环生成实验3种生成方式一实验看明白教程最巧妙的设计是不训练任何神经网络用三行规则手写生成器让目标分布变成半径为 $R$ 的圆环$x_1^2x_2^2R^2$直观对比三种生成思路。① 直接采样知道公式就能生成如果目标分布有显式数学形式直接按角度均匀采样即可代码见 direct.py。② 模拟 VAE一步生成VAE 的生成逻辑是先采样潜变量再过 decoder$z \sim \mathcal{N}(0, I)$然后 $x f(z)$。教程用一个手写投影规则 $x R \cdot z/|z|$ 模拟 decoder注意VAE 是一步生成decoder 要在一次前向传播中完成全部生成结果容易偏平均。代码见 vae_imitate.py。③ 模拟 DDPM多步去噪DDPM 不急着一步到位而是从纯噪声出发每一步做一件小事——预测干净点 往它靠近一点 加一点更小的噪声x0_hat R * x / norm # 手写去噪模型投影到圆周 x (1-gamma) * x gamma * x0_hat sigma * noise50 步之后噪声团逐渐被推到圆周上。这张图完整展示了每一步的演化轨迹代码见 ddpm_imitat.py。 实验结论真实任务中我们没有圆环公式这种显式分布必须用神经网络把分布学出来——这就是下一节 VAE 与 DDPM 真正要做的事。VAE 教程从重建到可采样生成的完整推导VAE详解与代码实现.md 按动机 → 推导 → 代码三步展开1. 为什么普通 Autoencoder 不能生成它的 encoder 输出确定点 $zf(x)$潜空间可能有空洞随机采样的 $z$ 未必能生成合理样本。VAE 的改动是让 encoder 输出一个分布$$q_{\phi}(z|x)\mathcal{N}(\mu_{\phi}(x), \mathrm{diag}(\sigma_{\phi}^2(x)))$$2. ELBO 怎么来的边缘似然 $\log p_\theta(x)$ 含不可解积分用 Jensen 不等式构造下界后展开就得到训练目标$$\text{VAE Loss} \underbrace{\mathbb{E}{q\phi(z|x)}[-\log p_\theta(x|z)]}{\text{重建损失}} \underbrace{D{KL}(q_\phi(z|x)|p(z))}_{\text{KL损失}}$$3. 重参数化技巧让采样可反传的关键代码里只有三行std torch.exp(0.5 * logvar) eps torch.randn_like(std) z mu std * eps4. 可运行实现U-Net 风格的 MNIST 图像生成训练脚本 train_mnist_unet_vae.py 会自动保存原图 vs 重建图和随机采样生成图两类对比图生成脚本 generate_mnist_unet_vae.py 只依赖训练好的 decoder无需训练数据。DDPM 实现加噪、噪声预测与去噪的完整闭环DDPM详解与代码实现.md约 2400 行含全部代数推导附录从 VAE 的局限讲起主线五步前向加噪固定规则不需要学习每一步 $x_t \sqrt{\alpha_t},x_{t-1} \sqrt{1-\alpha_t},\epsilon_t$$t$ 足够大时图像变成纯高斯噪声。闭式加噪公式$\bar{\alpha}t \prod{s1}^t \alpha_s$训练时可直接一步构造任意时刻的 $x_t$不用逐帧加噪$$x_t \sqrt{\bar{\alpha}_t},x_0 \sqrt{1-\bar{\alpha}_t},\epsilon$$反向过程需要学习训练网络 $\epsilon_\theta(x_t, t)$ 预测加进去的噪声——因为噪声是自己采样的标签天然已知DDPM 最终化简为最直观的监督任务$$\mathcal{L}{simple}(\theta) \mathbb{E}{t,x_0,\epsilon}\left[|\epsilon - \epsilon_\theta(x_t, t)|^2\right]$$一次训练迭代只有六步取图 $x_0$ → 随机时间步 $t$ → 采样噪声 $\epsilon$ → 构造 $x_t$ → 预测 $\epsilon$ → 算 MSE。采样生成从 $x_T \sim \mathcal{N}(0, I)$ 出发按 $T \to 1$ 逐步去噪最后一步不再加随机噪声x mean if step 0 else mean torch.sqrt(beta_t) * torch.randn_like(x)代码实现同样完整可跑train_stl10_ddpm.pySTL10 彩色图像 带时间嵌入的小型 U-Net和 generate_stl10_ddpm.py。教程刻意保留最基础配置线性 beta schedule、噪声预测、MSE目的是先跑通闭环——学完后再叠加注意力、分类条件、DDIM 加速等改进。快速上手三步跑通你的第一个扩散模型克隆仓库git clone https://gitcode.com/gh_mirrors/ev/every-embodied安装依赖教程只需 PyTorch 生态MNIST 会自动下载STL10 首次运行也会自动下载pip install torch torchvision matplotlib按顺序运行圆环实验零门槛先建立直觉python 17-具身世界模型/1、扩散数理基础及问题解析入门/code/vae_imitate.py python 17-具身世界模型/2、VAE详解与代码实现/code/train_mnist_unet_vae.py --epochs 20 python 17-具身世界模型/3、DDPM详解与代码实现/code/train_stl10_ddpm.py --epochs 20 --batch-size 32有 CUDA 显卡会自动使用 GPU训练过程中脚本会自动保存采样对比图直观看到噪声 → 图像的收敛过程。学习路线从扩散基础通往具身世界模型完成本课 3 个章节后你已经掌握了扩散生成模型的全部数理基础可以顺着 Every-Embodied 的17-具身世界模型章节继续进阶到具身应用BWM 动作条件世界模型把动作注入扩散过程学习给定动作的未来帧README.mdGE-Sim-V2 闭环视频世界模拟器用视频世界模型做机器人闭环评测README.mdGamma-World 多智能体世界模型多机器人交互场景的预测建模README.mdWALL-WM 事件级世界动作模型、WoG 条件空间世界模型、tau0-WM 统一视频动作世界模型事件级、空间级、视频级的不同建模粒度RISE 自我改进机器人策略世界模型 自我改进闭环的前沿复现小结具身世界模型的发动机是扩散模型扩散模型的骨架是 VAE 建立的变分推断思想和 DDPM 的多步去噪框架。Every-Embodied 用圆环小实验 → MNIST VAE → STL10 DDPM三级火箭配合完整推导与可运行代码帮你用最少的前置知识吃透这条数理脉络——系好安全带我们继续发车【免费下载链接】every-embodied仅需Python基础从0构建自己的具身智能机器人从0逐步构建VLA/OpenVLA/SmolVLA/Pi0 深入理解具身智能项目地址: https://gitcode.com/gh_mirrors/ev/every-embodied创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表