RLHF 深度解析:从人类反馈到 PPO/GRPO/DPO 的对齐革命
深入解析基于人类反馈的强化学习(RLHF)及其衍生算法(PPO、GRPO、DPO、IPO、KTO、SimPO)。从奖励建模、策略优化、参考策略约束到免 RL 的直接偏好对齐,涵盖数学推导、代码实现与工程实践。
RoPE (Rotary Position Embedding) 深度解析:旋转位置编码的数学之美
深入解析大语言模型中的旋转位置编码(RoPE)。涵盖位置编码的发展历程、RoPE 的数学推导、复数旋转的几何直觉、在 LLaMA/GPT-NeoX 等模型中的应用、与 ALiBi 的对比、以及 NTK-Aware Scaling 等扩展技术。
深度解析 Scaffold-GS:结构化 3D 高斯与视角自适应渲染
全面解析 CVPR 2024 的 Scaffold-GS 论文,涵盖其双层结构(锚点 + 神经高斯)、视角自适应属性预测、多分辨率体素生长与修剪策略、以及相比原始 3DGS 在存储压缩与复杂场景鲁棒性上的显著提升。
Stable Diffusion LoRA 微调:从 Dreambooth 到社区生态的完整指南
系统解析 Stable Diffusion LoRA 微调的完整技术栈——DreamBooth(主体级微调)、Textual Inversion(词嵌入学习)、LoRA(低秩适配器)、LyCORIS(LoRA 变体集合)、社区生态(Civitai/ComfyUI),以及 SD 1.x/2.x/SDXL 各模型层的微调配置与 PyTorch 完整实现。
深入理解状态空间模型 (SSM):RNN 与 Transformer 的优雅融合
全面解析状态空间模型(SSM)的核心原理,从经典卡尔曼滤波到现代 S4、Mamba 架构,探索其在长序列建模中的高效与并行优势。
监督微调 SFT:从基础模型到任务专家的关键一步
全面解析监督微调(SFT)技术,包括数据工程、训练范式(全参数/LoRA/QLoRA)、指令微调、Chat Template、超参数调优及与 RLHF/DPO 的对比。
推理时扩展深度解析:Test-Time Scaling 的理论与实践
深入解析推理时扩展(Test-Time Scaling / Inference-Time Compute)技术。涵盖 Chain-of-Thought、Self-Consistency、Tree of Thoughts、Best-of-N、Beam Search、Process Reward Model、STaR 等核心方法,以及 scaling laws 在推理阶段的应用与前沿探索。
深度解析 Microsoft TRELLIS:结构化潜在表示与可扩展的 3D 资产生成
全面解析 Microsoft TRELLIS 的核心技术,包括 SLAT(结构化潜在表示)、双阶段生成管线、Rectified Flow Transformer、多格式解码,以及它与 DreamFusion、One-2-3-45、3DGS 等前代工作的对比。
视频生成模型深度解析:从 Video DiT 到 Sora 架构
系统解析视频生成扩散模型的技术栈——视频扩散模型的核心挑战、时空 patchify 扩展、Video DiT 架构、Sora 技术报告解读、开源替代方案(CogVideoX / Wan2.1 / Open-Sora)、Latent Video Diffusion (VideoLDM / LVDM)、3D 时空注意力、因果掩码,以及完整 PyTorch 实现与未来趋势。
VLA 架构深度剖析:视觉语言动作模型与机器人操控
系统解析 Vision-Language-Action(VLA)模型的完整技术栈——从 VLM 到 VLA 的跨越、动作空间设计(离散/连续/混合)、动作分块(Action Chunking)、RT-2 / OpenVLA / π₀ / OpenHands-VLA 等架构对比、模仿学习与 RL 训练范式,以及 PyTorch 完整实现。

