多模态大模型 VLM 架构:从模态对齐到 GPT-4V 的完整技术栈
系统解析视觉语言模型(VLM)的完整技术栈——视觉编码器(CLIP/SigLIP)、模态对齐层(MLP/MLP-Mixer/Cross-Attention)、LLM 骨干、训练范式(预训练/对齐/指令微调)、LLaVA/InstructBLIP/Qwen-VL/GPT-4V 架构对比,以及 PyTorch 完整实现。
#VLM#多模态#视觉语言模型#LLaVA#GPT-4V
深入理解 Vision Transformer (ViT):图像识别的范式革新
全面解析 Vision Transformer (ViT) 的核心原理,包括图像分块、位置编码、分类 Token、归纳偏置的取舍,以及与 CNN 的对比、Swin Transformer 等后续改进。
#Vision Transformer#ViT#图像识别#自注意力#计算机视觉
vLLM 深度解析:高效 LLM 推理引擎的架构与实践
深入解析 vLLM 推理引擎的架构与优化技术。涵盖 PagedAttention 机制、KV Cache 管理、Continuous Batching、Tensor Parallelism、Prefix Caching 等核心优化,以及生产环境部署与性能调优的最佳实践。
#vLLM#LLM Inference#PagedAttention#KV Cache#Continuous Batching
YaRN / LongRoPE 深度解析:大模型上下文扩展技术
深入解析大语言模型上下文扩展技术。涵盖 RoPE 位置编码的局限性、YaRN (Position Interpolation + Attention Scaling + Freq Adjustment)、LongRoPE 非均匀插值、以及 NTK-Aware Scaling 等技术原理与实践。
#YaRN#LongRoPE#Context Extension#Position Encoding#RoPE Scaling
深入理解扩散模型 (Diffusion Model):从原理到实践
全面解析扩散模型的核心原理,包括前向扩散过程、逆向去噪过程、噪声调度策略,以及 Stable Diffusion、DALL-E 等实际应用。
#Diffusion#生成式AI#Stable Diffusion#去噪扩散#GAN对比
深入理解 Transformer 架构:从注意力机制到 GPT
全面解析 Transformer 架构的核心原理,包括自注意力机制、多头注意力、位置编码,以及它在 GPT、BERT 等大模型中的应用。
#Transformer#深度学习#大语言模型#Attention#自注意力
MDX 格式文章示例
这是一个 MDX 格式的示例文章,展示了如何在 Markdown 中使用 JSX。
#MDX#Markdown#文章示例
Profile Image of the Author

Federico

AI Research Lab

Hello, I'm Federico.

关于实验室 / About
公告

欢迎来到Federico的个人博客

分类
标签
站点统计
57文章
7分类
404标签

当前页面没有目录