知识蒸馏深度解析:从大模型到小模型的智能迁移
深入解析知识蒸馏(Knowledge Distillation)的理论与实践。从 Hinton 的经典工作到 LLM 时代的蒸馏技术,涵盖 Response/Feature/Representation/Relation KD、LLM 专用蒸馏方法(MiniLLM、MiniPLM、GKD、SEAL)、蒸馏数据构建、最佳实践与调参指南。
#Knowledge Distillation#Model Compression#LLM Distillation#Response Distillation#Feature Distillation
KV Cache 优化与内存管理深度解析:PagedAttention 原理与实践
深入解析 LLM 推理中 KV Cache 的内存管理优化技术。涵盖标准 Attention 的内存瓶颈、PagedAttention 机制、Block Table 设计、内存碎片问题、前缀缓存与共享、Eviction 策略,以及生产环境中的内存调优实践。
#KV Cache#PagedAttention#LLM Inference#Memory Management#GPU Optimization
Latent Diffusion Model 深度剖析:从像素扩散到潜在空间生成
系统解析 Latent Diffusion Model(LDM / Stable Diffusion)的完整技术栈——感知压缩与语义压缩的分界、VAE 编码器/解码器设计、UNet 在潜空间中的架构改进、交叉注意力条件注入机制、CIN 层级、SD 1.x/2.x/SDXL 版本演进,以及 PyTorch 完整实现。
#LDM#Stable Diffusion#潜在扩散模型#VAE#感知压缩
LLaVA 深度剖析:从视觉指令微调到开源多模态助手的完整技术栈
系统解析 LLaVA (Large Language and Vision Assistant) 的完整技术栈——视觉指令微调范式、LLaVA-Instruct 数据集构建方法、两阶段训练流程(模态预训练+指令微调)、LLaVA-1.5 的关键改进(MLP 投影/336px/OCR 数据)、与 GPT-4V 的对比,以及 PyTorch 完整实现。
#LLaVA#视觉指令微调#多模态助手#Vicuna#GPT-4V
深度解析 LRM:大型重建模型与单图像 3D 重建的突破
全面解析大型重建模型(Large Reconstruction Model, LRM)的核心技术,涵盖 One-2-3-45、OpenLRM、TripoSG、InstantMesh、SPAR3D 等代表性工作的架构设计与创新,以及前馈重建与 SDS 优化两条路线的深度对比。
#LRM#Large Reconstruction Model#单图像3D重建#One-2-3-45#OpenLRM
深入理解 Mamba:选择性状态空间模型的架构与实现
深度解析 Mamba 状态空间模型架构,包括选择性扫描机制、硬件感知算法、SSD 状态空间对偶性,以及 Mamba-2 与混合架构的最新进展。
#Mamba#SSM#状态空间模型#选择性扫描#选择性状态空间
深度解析 MASt3R:融合 3D 几何的稠密匹配新范式
全面解析 ECCV 2024 的 MASt3R 论文,涵盖其对 DUSt3R 的关键升级(局部特征描述子 + Metric Pointmap)、Fast Reciprocal Matching 高效匹配算法、Coarse-to-Fine 策略,以及如何用单一模型在视觉定位、多目重建等任务上达到 SOTA。
#MASt3R#3D匹配#DUSt3R#ECCV 2024#局部特征
深度解析 MeshFlow:MeshVAE + Flow Matching DiT 实现高效艺术家风格网格生成
全面解析 CVPR 2026 Highlight 的 MeshFlow 论文,涵盖其连续网格表示(顶点 + 法向量 + 边嵌入)、MeshVAE(TokenMerge/Split)、Flow-based Diffusion Transformer,以及如何实现 ~1 秒的艺术家风格网格生成,速度比自回归方法快 18 倍且避免坐标量化。
#MeshFlow#MeshVAE#Flow Matching#DiT#CVPR 2026
深入理解 MoE (混合专家模型):稀疏激活与高效扩展
全面解析混合专家模型(MoE)的核心原理,包括稀疏门控机制、路由策略、负载均衡,以及 Mixtral、DeepSeek-MoE、Grok-1 等实际应用。
#MoE#混合专家模型#大语言模型#稀疏激活#Transformer
深入理解 MMDiT:多模态扩散 Transformer 与 Stable Diffusion 3 革命
全面解析 MMDiT (Multimodal Diffusion Transformer) 的核心架构——Stable Diffusion 3 与 Flux 的灵魂设计,包括双流联合注意力、文本-图像 token 交互、Rectified Flow,以及与 SDXL、FLUX 等模型的关系。
#MMDiT#Multimodal#Stable Diffusion 3#SD3#FLUX
Profile Image of the Author

Federico

AI Research Lab

Hello, I'm Federico.

关于实验室 / About
公告

欢迎来到Federico的个人博客

分类
标签
站点统计
57文章
7分类
404标签

当前页面没有目录