公告
欢迎来到Federico的个人博客
分类
标签
3D VAE3DGS3D匹配3D生成3D网格生成3D重建4-bitActingActionMeshActivation QuantizationAdaLNAdapterAdvantage EstimationAgentAgent ArchitectureAI AgentAI绘画AlignmentAlignment TaxAttentionAttention MechanismAutoGPTAWQBeam SearchBERTBest-of-NBradley-TerryCache EvictionChain-of-ThoughtChat TemplateCivitaiClaudeCLIPCMCogVideoXCommunicationConsistency DistillationConsistency ModelsConstitutional AIContext ExtensionContext Length ExtensionContinuous BatchingControlNetControlNet-XSCoTCroCoCUDA GraphsCurriculum LearningCVPR 2024CVPR 2026Dark KnowledgeData ConstructionData DeduplicationData EngineeringData FilteringData ParallelismData QualityData ScalingDataset CurationDDIMDDPMDeepSeekDeepSeek-R1DeepSeek-R1-ZeroDeepSpeedDiffusionDiffusion TransformerDirect Preference OptimizationDistillationDistributed TrainingDistribution ShiftDiTDoRADPODreamBoothDreamboothDUSt3RECCV 2024EDMELBOFast Reciprocal MatchingFeature DistillationFlashAttentionFlow MatchingFLUXFSDPFunction CallingGAEGAN对比Gaussian SplattingGGUFGoodhart's LawGPTGPT-4VGPTQGPU ClusterGPU OptimizationGradient SynchronizationGroup Relative Policy OptimizationGRPOGuanacoHoHugging FaceHunyuan3DHunyuanDiTInference Scaling LawInference-Time ComputeInstantMeshInstruction FollowingInstruction TuningINT4INT8IPOJambaJSON SchemaKL DivergenceKnowledge DistillationKTOKV CacheLangGraphLanguage ModelLarge Reconstruction ModelLatent Video DiffusionLCMLDMLipmanLlamaLLaMAllama.cppLLaVALLaVA-1.5LLaVA-1.6LLMLLM AgentLLM AlignmentLLM DistillationLLM Fine-TuningLLM InferenceLLM ReasoningLLM SafetyLLM ScalingLLM TrainingLong ContextLongRoPELoRALow-Rank AdaptationLRMLVDMLyCORISMambaMamba-2MarkdownMASt3RMath ReasoningMDXMegatron-LMMemoryMemory ManagementMemory OptimizationMeshMeshFlowMeshVAEMetric PointmapMiniLLMMixed PrecisionMixtralMLPMMDiTModel AlignmentModel CompressionModel MergingModel OptimizationModel ParallelismMoEMulti-AgentMultimodalNeRFNF4NTKODEOne-2-3-45Open-SoraOpenAIOpenLRMOpenVLAOptimal TransportORPOOveroptimizationPagedAttentionParameter-EfficientParameter-Efficient Fine-TuningPBR材质PEFTPhysical AIPipeline ParallelismPlanningPointmapPolicy GradientPosition EncodingPosition InterpolationPost-TrainingPPOPre-trainingPre-training DataPreference AlignmentPreference DataPreference LearningPrefix CachingPrefix TuningPRMProcess Reward ModelPrompt EngineeringPrompt TuningProximal Policy OptimizationQLoRAQuantizationQwen-VLRadfordReActReasoningReasoning ModelsRectified FlowReinforced Fine-TuningReinforcement LearningRelative PositionResponse DistillationReward HackingReward ModelReward ModelingRLAIFRLHFRoPERoPE ScalingRotary EmbeddingsRotary Position EmbeddingRT-2S4Scaffold-GSScaling LawsScore MatchingSD3SDXL LoRASD微调Self-ConsistencySequence ParallelismServingSFTSFT DataSimPOSLATSongSong ChunLIUSoraSSMStable DiffusionStable Diffusion 3Stable Diffusion XLStable Diffusion微调Supervised Fine-TuningT2I-AdapterTemporal 3D DiffusionTensor ParallelismTest-Time ScalingText-to-ImageTextual InversionTokenMergeTool UseTraining ObjectiveTransfer LearningTransformerTree of ThoughtsTRELLISTripoSGTRPOTrust RegionTTCTTTSTUNetVAEVecSetVicunaVideo DiffusionVideo DiTVideo-to-4DVideoLDMVision TransformerViTVLAvLLMVLMWan2.1Weight DecompositionWeight QuantizationYaRNYarnZero-shotπ₀一步生成三维重建交叉注意力位姿估计体渲染体积渲染具身智能前馈生成加速推理动作分块动画网格生成单图像3D单图像3D重建去噪扩散变分推断可微渲染图像分类图像理解图像生成图像识别多格式输出多模态多模态助手多模态控制多模态推理多目立体大语言模型姿态控制对比学习局部特征常微分方程开源 VLM循环神经网络微软思维链感知压缩扩散模型扩散模型加速扩散模型蒸馏拓扑一致指令微调推理文本到图像文本编码器文章示例新视角合成无监督标定时序一致性时空建模机器人学习机器人操控条件扩散条件生成概率流模仿学习模型扩展模态对齐深度估计深度图控制深度学习混元3D混合专家模型潜在扩散模型点云条件生成状态空间模型生成式 AI生成式AI确定性采样视觉定位视觉指令微调视觉理解视觉生成视觉语言动作模型视觉语言模型视觉语言预训练视角自适应视频压缩视频生成神经渲染神经辐射场稀疏激活稠密匹配纹理合成线性注意力结构化潜在表示结构化高斯腾讯自注意力艺术家风格计算机图形学计算机视觉语义压缩语言模型轨迹视图辐射场边缘检测连续潜在空间逆向过程选择性扫描选择性状态空间锚点长序列建模隐式模型零样本分类零样本迁移非马尔可夫高斯泼溅
多模态大模型 VLM 架构:从模态对齐到 GPT-4V 的完整技术栈
2026-07-16
系统解析视觉语言模型(VLM)的完整技术栈——视觉编码器(CLIP/SigLIP)、模态对齐层(MLP/MLP-Mixer/Cross-Attention)、LLM 骨干、训练范式(预训练/对齐/指令微调)、LLaVA/InstructBLIP/Qwen-VL/GPT-4V 架构对比,以及 PyTorch 完整实现。
深入理解 Vision Transformer (ViT):图像识别的范式革新
2026-07-16
全面解析 Vision Transformer (ViT) 的核心原理,包括图像分块、位置编码、分类 Token、归纳偏置的取舍,以及与 CNN 的对比、Swin Transformer 等后续改进。
vLLM 深度解析:高效 LLM 推理引擎的架构与实践
2026-07-16
深入解析 vLLM 推理引擎的架构与优化技术。涵盖 PagedAttention 机制、KV Cache 管理、Continuous Batching、Tensor Parallelism、Prefix Caching 等核心优化,以及生产环境部署与性能调优的最佳实践。
YaRN / LongRoPE 深度解析:大模型上下文扩展技术
2026-07-16
深入解析大语言模型上下文扩展技术。涵盖 RoPE 位置编码的局限性、YaRN (Position Interpolation + Attention Scaling + Freq Adjustment)、LongRoPE 非均匀插值、以及 NTK-Aware Scaling 等技术原理与实践。
深入理解扩散模型 (Diffusion Model):从原理到实践
2026-07-14
全面解析扩散模型的核心原理,包括前向扩散过程、逆向去噪过程、噪声调度策略,以及 Stable Diffusion、DALL-E 等实际应用。
深入理解 Transformer 架构:从注意力机制到 GPT
2026-07-14
全面解析 Transformer 架构的核心原理,包括自注意力机制、多头注意力、位置编码,以及它在 GPT、BERT 等大模型中的应用。
站点统计
57文章
7分类
404标签
日
一
二
三
四
五
六
文章目录
当前页面没有目录
公告
欢迎来到Federico的个人博客
分类
标签
3D VAE3DGS3D匹配3D生成3D网格生成3D重建4-bitActingActionMeshActivation QuantizationAdaLNAdapterAdvantage EstimationAgentAgent ArchitectureAI AgentAI绘画AlignmentAlignment TaxAttentionAttention MechanismAutoGPTAWQBeam SearchBERTBest-of-NBradley-TerryCache EvictionChain-of-ThoughtChat TemplateCivitaiClaudeCLIPCMCogVideoXCommunicationConsistency DistillationConsistency ModelsConstitutional AIContext ExtensionContext Length ExtensionContinuous BatchingControlNetControlNet-XSCoTCroCoCUDA GraphsCurriculum LearningCVPR 2024CVPR 2026Dark KnowledgeData ConstructionData DeduplicationData EngineeringData FilteringData ParallelismData QualityData ScalingDataset CurationDDIMDDPMDeepSeekDeepSeek-R1DeepSeek-R1-ZeroDeepSpeedDiffusionDiffusion TransformerDirect Preference OptimizationDistillationDistributed TrainingDistribution ShiftDiTDoRADPODreamBoothDreamboothDUSt3RECCV 2024EDMELBOFast Reciprocal MatchingFeature DistillationFlashAttentionFlow MatchingFLUXFSDPFunction CallingGAEGAN对比Gaussian SplattingGGUFGoodhart's LawGPTGPT-4VGPTQGPU ClusterGPU OptimizationGradient SynchronizationGroup Relative Policy OptimizationGRPOGuanacoHoHugging FaceHunyuan3DHunyuanDiTInference Scaling LawInference-Time ComputeInstantMeshInstruction FollowingInstruction TuningINT4INT8IPOJambaJSON SchemaKL DivergenceKnowledge DistillationKTOKV CacheLangGraphLanguage ModelLarge Reconstruction ModelLatent Video DiffusionLCMLDMLipmanLlamaLLaMAllama.cppLLaVALLaVA-1.5LLaVA-1.6LLMLLM AgentLLM AlignmentLLM DistillationLLM Fine-TuningLLM InferenceLLM ReasoningLLM SafetyLLM ScalingLLM TrainingLong ContextLongRoPELoRALow-Rank AdaptationLRMLVDMLyCORISMambaMamba-2MarkdownMASt3RMath ReasoningMDXMegatron-LMMemoryMemory ManagementMemory OptimizationMeshMeshFlowMeshVAEMetric PointmapMiniLLMMixed PrecisionMixtralMLPMMDiTModel AlignmentModel CompressionModel MergingModel OptimizationModel ParallelismMoEMulti-AgentMultimodalNeRFNF4NTKODEOne-2-3-45Open-SoraOpenAIOpenLRMOpenVLAOptimal TransportORPOOveroptimizationPagedAttentionParameter-EfficientParameter-Efficient Fine-TuningPBR材质PEFTPhysical AIPipeline ParallelismPlanningPointmapPolicy GradientPosition EncodingPosition InterpolationPost-TrainingPPOPre-trainingPre-training DataPreference AlignmentPreference DataPreference LearningPrefix CachingPrefix TuningPRMProcess Reward ModelPrompt EngineeringPrompt TuningProximal Policy OptimizationQLoRAQuantizationQwen-VLRadfordReActReasoningReasoning ModelsRectified FlowReinforced Fine-TuningReinforcement LearningRelative PositionResponse DistillationReward HackingReward ModelReward ModelingRLAIFRLHFRoPERoPE ScalingRotary EmbeddingsRotary Position EmbeddingRT-2S4Scaffold-GSScaling LawsScore MatchingSD3SDXL LoRASD微调Self-ConsistencySequence ParallelismServingSFTSFT DataSimPOSLATSongSong ChunLIUSoraSSMStable DiffusionStable Diffusion 3Stable Diffusion XLStable Diffusion微调Supervised Fine-TuningT2I-AdapterTemporal 3D DiffusionTensor ParallelismTest-Time ScalingText-to-ImageTextual InversionTokenMergeTool UseTraining ObjectiveTransfer LearningTransformerTree of ThoughtsTRELLISTripoSGTRPOTrust RegionTTCTTTSTUNetVAEVecSetVicunaVideo DiffusionVideo DiTVideo-to-4DVideoLDMVision TransformerViTVLAvLLMVLMWan2.1Weight DecompositionWeight QuantizationYaRNYarnZero-shotπ₀一步生成三维重建交叉注意力位姿估计体渲染体积渲染具身智能前馈生成加速推理动作分块动画网格生成单图像3D单图像3D重建去噪扩散变分推断可微渲染图像分类图像理解图像生成图像识别多格式输出多模态多模态助手多模态控制多模态推理多目立体大语言模型姿态控制对比学习局部特征常微分方程开源 VLM循环神经网络微软思维链感知压缩扩散模型扩散模型加速扩散模型蒸馏拓扑一致指令微调推理文本到图像文本编码器文章示例新视角合成无监督标定时序一致性时空建模机器人学习机器人操控条件扩散条件生成概率流模仿学习模型扩展模态对齐深度估计深度图控制深度学习混元3D混合专家模型潜在扩散模型点云条件生成状态空间模型生成式 AI生成式AI确定性采样视觉定位视觉指令微调视觉理解视觉生成视觉语言动作模型视觉语言模型视觉语言预训练视角自适应视频压缩视频生成神经渲染神经辐射场稀疏激活稠密匹配纹理合成线性注意力结构化潜在表示结构化高斯腾讯自注意力艺术家风格计算机图形学计算机视觉语义压缩语言模型轨迹视图辐射场边缘检测连续潜在空间逆向过程选择性扫描选择性状态空间锚点长序列建模隐式模型零样本分类零样本迁移非马尔可夫高斯泼溅
站点统计
57文章
7分类
404标签

