DeepSeek-R1 深度解析:推理能力涌现与纯 RL 的范式突破
全面解析 DeepSeek-R1 与 DeepSeek-R1-Zero 的技术突破。涵盖纯 RL 训练流程、思维链(Chain-of-Thought)自动涌现机制、四阶段训练流水线(GRPO → RFT → 拒绝采样 → 多场景 GRPO)、知识蒸馏小模型、以及对 LLM 推理能力发展路径的深远影响。
#DeepSeek-R1#DeepSeek-R1-Zero#Chain-of-Thought#Reinforcement Learning#LLM Reasoning
深入理解 Diffusion Transformer (DiT):扩散模型的 Transformer 范式
全面解析 Diffusion Transformer (DiT) 的核心架构,包括 Patchify、AdaLN-Zero、3 种条件注入策略、Gflops 缩放定律,以及与 UNet 后端的对比、Sora 视觉生成的奠基性影响。
#DiT#Diffusion Transformer#生成式AI#Stable Diffusion#扩散模型
分布式训练深度解析:Data / Tensor / Pipeline / Sequence Parallelism
深入解析大模型分布式训练的并行策略。涵盖 Data Parallelism、Tensor Parallelism、Pipeline Parallelism、Sequence Parallelism 的核心原理、架构设计、通信模式、混合并行策略,以及 PyTorch FSDP、DeepSpeed、Megatron-LM 等主流框架的实战指南。
#Distributed Training#Data Parallelism#Tensor Parallelism#Pipeline Parallelism#Sequence Parallelism
DoRA 深度解析:权重分解低秩适应的理论与实践
深入解析 DoRA(Weight-Decomposed Low-Rank Adaptation)技术。从权重分解的数学原理出发,对比 LoRA 与 DoRA 的本质差异,分析 DoRA 的收敛特性和在各任务上的性能表现,提供完整的实现代码与调优指南。
#DoRA#LoRA#PEFT#Weight Decomposition#Low-Rank Adaptation
DPO 深度解析:绕过强化学习的直接偏好优化
深度解析 Direct Preference Optimization(DPO)的完整数学推导、理论证明、实现细节与工程实践。涵盖从 RLHF 到 DPO 的范式转变、Bradley-Terry 与最优策略的闭式联系、IPO/KTO/SimPO/ORPO 等变体算法,以及训练失败模式的系统性分析与缓解策略。
#DPO#Direct Preference Optimization#LLM Alignment#IPO#KTO
深度解析 DUSt3R:无需相机标定的稠密无约束立体 3D 重建
全面解析 CVPR 2024 的 DUSt3R 论文,涵盖其革命性的 Pointmap 表示、Asymmetric CroCo Transformer 架构、置信度感知损失函数、全局对齐策略,以及如何用单一模型统一单目/多目深度估计、相对/绝对位姿估计、稠密匹配等多项 3D 视觉任务。
#DUSt3R#3D重建#Pointmap#CroCo#CVPR 2024
深入理解 Flow Matching:生成建模的统一理论框架
从常微分方程出发,系统推导 Flow Matching 理论——生成建模的"万有理论框架"。涵盖概率流 ODE、条件流匹配定理、Optimal Transport 路径、最优传输映射,以及 DDPM / Rectified Flow / Linear Flow 的统一解释。
#Flow Matching#生成式AI#扩散模型#Optimal Transport#Rectified Flow
深入理解 Function Calling:让大模型连接真实世界
全面解析 Function Calling / Tool Use 机制,包括 JSON Schema 规范、OpenAI/Claude/Gemini 实现、并行调用、错误处理及生产环境的最佳实践。
#Function Calling#Tool Use#Function Calling#JSON Schema#大语言模型
GRPO 深度解析:DeepSeek 的高效对齐算法与数学推理革命
深入解析 GRPO(Group Relative Policy Optimization)算法的数学原理、与 PPO/DPO 的对比、工程实现、以及 DeepSeek-R1 如何用 GRPO 实现了推理能力的突破。涵盖组内归一化优势估计、自熵正则、Reinforced Fine-Tuning、以及 GRPO 的理论分析。
#GRPO#Group Relative Policy Optimization#DeepSeek#Reinforcement Learning#LLM Alignment
深度解析腾讯混元 3D (Hunyuan3D):大规模扩散模型的 3D 资产生成
全面解析腾讯混元 3D (Hunyuan3D) 系列的核心技术,涵盖 Hunyuan3D 1.0/2.0/2.1/2.5 的演进路线、双阶段管线(DiT 形状生成 + Paint 纹理合成)、Flow Matching 扩散范式、PBR 材质、以及与 Trellis/TripoSG 等工作的对比。
#Hunyuan3D#混元3D#腾讯#3D生成#Flow Matching
Profile Image of the Author

Federico

AI Research Lab

Hello, I'm Federico.

关于实验室 / About
公告

欢迎来到Federico的个人博客

分类
标签
站点统计
57文章
7分类
404标签

当前页面没有目录