公告
欢迎来到Federico的个人博客
分类
标签
3D VAE3DGS3D匹配3D生成3D网格生成3D重建4-bitActingActionMeshActivation QuantizationAdaLNAdapterAdvantage EstimationAgentAgent ArchitectureAI AgentAI绘画AlignmentAlignment TaxAttentionAttention MechanismAutoGPTAWQBeam SearchBERTBest-of-NBradley-TerryCache EvictionChain-of-ThoughtChat TemplateCivitaiClaudeCLIPCMCogVideoXCommunicationConsistency DistillationConsistency ModelsConstitutional AIContext ExtensionContext Length ExtensionContinuous BatchingControlNetControlNet-XSCoTCroCoCUDA GraphsCurriculum LearningCVPR 2024CVPR 2026Dark KnowledgeData ConstructionData DeduplicationData EngineeringData FilteringData ParallelismData QualityData ScalingDataset CurationDDIMDDPMDeepSeekDeepSeek-R1DeepSeek-R1-ZeroDeepSpeedDiffusionDiffusion TransformerDirect Preference OptimizationDistillationDistributed TrainingDistribution ShiftDiTDoRADPODreamBoothDreamboothDUSt3RECCV 2024EDMELBOFast Reciprocal MatchingFeature DistillationFlashAttentionFlow MatchingFLUXFSDPFunction CallingGAEGAN对比Gaussian SplattingGGUFGoodhart's LawGPTGPT-4VGPTQGPU ClusterGPU OptimizationGradient SynchronizationGroup Relative Policy OptimizationGRPOGuanacoHoHugging FaceHunyuan3DHunyuanDiTInference Scaling LawInference-Time ComputeInstantMeshInstruction FollowingInstruction TuningINT4INT8IPOJambaJSON SchemaKL DivergenceKnowledge DistillationKTOKV CacheLangGraphLanguage ModelLarge Reconstruction ModelLatent Video DiffusionLCMLDMLipmanLlamaLLaMAllama.cppLLaVALLaVA-1.5LLaVA-1.6LLMLLM AgentLLM AlignmentLLM DistillationLLM Fine-TuningLLM InferenceLLM ReasoningLLM SafetyLLM ScalingLLM TrainingLong ContextLongRoPELoRALow-Rank AdaptationLRMLVDMLyCORISMambaMamba-2MarkdownMASt3RMath ReasoningMDXMegatron-LMMemoryMemory ManagementMemory OptimizationMeshMeshFlowMeshVAEMetric PointmapMiniLLMMixed PrecisionMixtralMLPMMDiTModel AlignmentModel CompressionModel MergingModel OptimizationModel ParallelismMoEMulti-AgentMultimodalNeRFNF4NTKODEOne-2-3-45Open-SoraOpenAIOpenLRMOpenVLAOptimal TransportORPOOveroptimizationPagedAttentionParameter-EfficientParameter-Efficient Fine-TuningPBR材质PEFTPhysical AIPipeline ParallelismPlanningPointmapPolicy GradientPosition EncodingPosition InterpolationPost-TrainingPPOPre-trainingPre-training DataPreference AlignmentPreference DataPreference LearningPrefix CachingPrefix TuningPRMProcess Reward ModelPrompt EngineeringPrompt TuningProximal Policy OptimizationQLoRAQuantizationQwen-VLRadfordReActReasoningReasoning ModelsRectified FlowReinforced Fine-TuningReinforcement LearningRelative PositionResponse DistillationReward HackingReward ModelReward ModelingRLAIFRLHFRoPERoPE ScalingRotary EmbeddingsRotary Position EmbeddingRT-2S4Scaffold-GSScaling LawsScore MatchingSD3SDXL LoRASD微调Self-ConsistencySequence ParallelismServingSFTSFT DataSimPOSLATSongSong ChunLIUSoraSSMStable DiffusionStable Diffusion 3Stable Diffusion XLStable Diffusion微调Supervised Fine-TuningT2I-AdapterTemporal 3D DiffusionTensor ParallelismTest-Time ScalingText-to-ImageTextual InversionTokenMergeTool UseTraining ObjectiveTransfer LearningTransformerTree of ThoughtsTRELLISTripoSGTRPOTrust RegionTTCTTTSTUNetVAEVecSetVicunaVideo DiffusionVideo DiTVideo-to-4DVideoLDMVision TransformerViTVLAvLLMVLMWan2.1Weight DecompositionWeight QuantizationYaRNYarnZero-shotπ₀一步生成三维重建交叉注意力位姿估计体渲染体积渲染具身智能前馈生成加速推理动作分块动画网格生成单图像3D单图像3D重建去噪扩散变分推断可微渲染图像分类图像理解图像生成图像识别多格式输出多模态多模态助手多模态控制多模态推理多目立体大语言模型姿态控制对比学习局部特征常微分方程开源 VLM循环神经网络微软思维链感知压缩扩散模型扩散模型加速扩散模型蒸馏拓扑一致指令微调推理文本到图像文本编码器文章示例新视角合成无监督标定时序一致性时空建模机器人学习机器人操控条件扩散条件生成概率流模仿学习模型扩展模态对齐深度估计深度图控制深度学习混元3D混合专家模型潜在扩散模型点云条件生成状态空间模型生成式 AI生成式AI确定性采样视觉定位视觉指令微调视觉理解视觉生成视觉语言动作模型视觉语言模型视觉语言预训练视角自适应视频压缩视频生成神经渲染神经辐射场稀疏激活稠密匹配纹理合成线性注意力结构化潜在表示结构化高斯腾讯自注意力艺术家风格计算机图形学计算机视觉语义压缩语言模型轨迹视图辐射场边缘检测连续潜在空间逆向过程选择性扫描选择性状态空间锚点长序列建模隐式模型零样本分类零样本迁移非马尔可夫高斯泼溅
深入理解神经辐射场 (NeRF):从体渲染到可微 3D 重建
2026-07-16
全面解析神经辐射场(NeRF)的核心原理,包括 5D 输入参数化、MLP 表征、体渲染积分、可微渲染训练流程,以及 Instant-NGP、Mip-NeRF 等重要改进。
参数高效微调深度解析:从 LoRA 到 QLoRA 的全面指南
2026-07-16
深入解析参数高效微调(PEFT)技术。重点覆盖 LoRA 及其变体(QLoRA、DoRA、LoRA+、PiSSA),同时解析 Adapter、Prefix Tuning、Prompt Tuning 等主流方法。从数学原理出发,建立完整的理论框架,分析秩选择、模块配置、权重合并等工程实践。
后训练深度解析:LLM 从基座到助手的能力锻造
2026-07-16
全面解析 LLM 后训练(Post-Training)的完整技术栈。涵盖监督微调(SFT)、偏好对齐(RLHF/DPO/GRPO/KTO)、多阶段训练流水线、数据工程(质量过滤、格式设计、课程学习)、超参数调优、评估体系、以及 DeepSeek/ChangGPT 等主流模型的训练实践。
PPO 深度解析:信赖域优化的艺术与 LLM 对齐实践
2026-07-16
从 TRPO 到 PPO 的演进、信赖域优化理论、GAE 优势估计、Clip 机制数学推导、KL 约束变体、PPO 用于 LLM 对齐的完整实现,以及训练稳定性、超参数调优与常见失败模式的系统性分析。
偏好对齐深度解析:从 RLHF 到 DPO/KTO 的技术演进
2026-07-16
深入解析大语言模型的偏好对齐技术。涵盖 RLHF(PPO)、DPO、GRPO、KTO、IPO、SimPO 等主流算法,从 Bradley-Terry 偏好模型出发,建立完整的理论框架,分析各方法的优缺点、收敛性、对齐税问题,以及工程实践中的数据构建、Reward Hacking 应对策略。
预训练策略:从 GPT 到 Llama,大模型的"九年义务教育"
2026-07-16
全面解析大模型预训练策略,包括训练目标、数据工程、tokenizer、分布式训练、Scaling Laws、超参数调优及最新研究进展。
QLoRA 深度解析:4-bit 量化与低秩适应的完美结合
2026-07-16
深入解析 QLoRA(Quantized Low-Rank Adaptation)技术。涵盖 NF4 量化原理、双重量化、分页优化器、显存计算,以及 Guanaco 系列模型的技术细节与训练实践。
模型量化与压缩深度解析:INT8/INT4/AWQ/GPTQ 全面指南
2026-07-16
深入解析大模型量化与压缩技术。涵盖 INT8/INT4 量化原理、GPTQ 训练后量化、AWQ 激活感知量化、GGUF/llama.cpp 实现,以及量化带来的性能损失分析与最佳实践。
深入理解 ReAct 模式:让大模型学会推理与行动
2026-07-16
全面解析 ReAct (Reasoning + Acting) 模式,包括其核心机制、工具调用集成、Agent 系统设计,以及与 CoT、Reflexion、AutoGPT 等模式的关系。
Reward Hacking 深度解析:LLM 对齐中的奖励黑客问题
2026-07-16
深入解析 RL 和 LLM 对齐中的 Reward Hacking 问题。涵盖 Goodhart's Law、Reward Hacking 的数学形式化、表现形式(长度作弊/格式填充/RM过拟合)、检测方法(分布分析/对抗测试/人类评估)、防御策略(KL约束/多样性正则/混合奖励/红队测试),以及工程实践中的监控与迭代。
站点统计
57文章
7分类
404标签
日
一
二
三
四
五
六
文章目录
当前页面没有目录
公告
欢迎来到Federico的个人博客
分类
标签
3D VAE3DGS3D匹配3D生成3D网格生成3D重建4-bitActingActionMeshActivation QuantizationAdaLNAdapterAdvantage EstimationAgentAgent ArchitectureAI AgentAI绘画AlignmentAlignment TaxAttentionAttention MechanismAutoGPTAWQBeam SearchBERTBest-of-NBradley-TerryCache EvictionChain-of-ThoughtChat TemplateCivitaiClaudeCLIPCMCogVideoXCommunicationConsistency DistillationConsistency ModelsConstitutional AIContext ExtensionContext Length ExtensionContinuous BatchingControlNetControlNet-XSCoTCroCoCUDA GraphsCurriculum LearningCVPR 2024CVPR 2026Dark KnowledgeData ConstructionData DeduplicationData EngineeringData FilteringData ParallelismData QualityData ScalingDataset CurationDDIMDDPMDeepSeekDeepSeek-R1DeepSeek-R1-ZeroDeepSpeedDiffusionDiffusion TransformerDirect Preference OptimizationDistillationDistributed TrainingDistribution ShiftDiTDoRADPODreamBoothDreamboothDUSt3RECCV 2024EDMELBOFast Reciprocal MatchingFeature DistillationFlashAttentionFlow MatchingFLUXFSDPFunction CallingGAEGAN对比Gaussian SplattingGGUFGoodhart's LawGPTGPT-4VGPTQGPU ClusterGPU OptimizationGradient SynchronizationGroup Relative Policy OptimizationGRPOGuanacoHoHugging FaceHunyuan3DHunyuanDiTInference Scaling LawInference-Time ComputeInstantMeshInstruction FollowingInstruction TuningINT4INT8IPOJambaJSON SchemaKL DivergenceKnowledge DistillationKTOKV CacheLangGraphLanguage ModelLarge Reconstruction ModelLatent Video DiffusionLCMLDMLipmanLlamaLLaMAllama.cppLLaVALLaVA-1.5LLaVA-1.6LLMLLM AgentLLM AlignmentLLM DistillationLLM Fine-TuningLLM InferenceLLM ReasoningLLM SafetyLLM ScalingLLM TrainingLong ContextLongRoPELoRALow-Rank AdaptationLRMLVDMLyCORISMambaMamba-2MarkdownMASt3RMath ReasoningMDXMegatron-LMMemoryMemory ManagementMemory OptimizationMeshMeshFlowMeshVAEMetric PointmapMiniLLMMixed PrecisionMixtralMLPMMDiTModel AlignmentModel CompressionModel MergingModel OptimizationModel ParallelismMoEMulti-AgentMultimodalNeRFNF4NTKODEOne-2-3-45Open-SoraOpenAIOpenLRMOpenVLAOptimal TransportORPOOveroptimizationPagedAttentionParameter-EfficientParameter-Efficient Fine-TuningPBR材质PEFTPhysical AIPipeline ParallelismPlanningPointmapPolicy GradientPosition EncodingPosition InterpolationPost-TrainingPPOPre-trainingPre-training DataPreference AlignmentPreference DataPreference LearningPrefix CachingPrefix TuningPRMProcess Reward ModelPrompt EngineeringPrompt TuningProximal Policy OptimizationQLoRAQuantizationQwen-VLRadfordReActReasoningReasoning ModelsRectified FlowReinforced Fine-TuningReinforcement LearningRelative PositionResponse DistillationReward HackingReward ModelReward ModelingRLAIFRLHFRoPERoPE ScalingRotary EmbeddingsRotary Position EmbeddingRT-2S4Scaffold-GSScaling LawsScore MatchingSD3SDXL LoRASD微调Self-ConsistencySequence ParallelismServingSFTSFT DataSimPOSLATSongSong ChunLIUSoraSSMStable DiffusionStable Diffusion 3Stable Diffusion XLStable Diffusion微调Supervised Fine-TuningT2I-AdapterTemporal 3D DiffusionTensor ParallelismTest-Time ScalingText-to-ImageTextual InversionTokenMergeTool UseTraining ObjectiveTransfer LearningTransformerTree of ThoughtsTRELLISTripoSGTRPOTrust RegionTTCTTTSTUNetVAEVecSetVicunaVideo DiffusionVideo DiTVideo-to-4DVideoLDMVision TransformerViTVLAvLLMVLMWan2.1Weight DecompositionWeight QuantizationYaRNYarnZero-shotπ₀一步生成三维重建交叉注意力位姿估计体渲染体积渲染具身智能前馈生成加速推理动作分块动画网格生成单图像3D单图像3D重建去噪扩散变分推断可微渲染图像分类图像理解图像生成图像识别多格式输出多模态多模态助手多模态控制多模态推理多目立体大语言模型姿态控制对比学习局部特征常微分方程开源 VLM循环神经网络微软思维链感知压缩扩散模型扩散模型加速扩散模型蒸馏拓扑一致指令微调推理文本到图像文本编码器文章示例新视角合成无监督标定时序一致性时空建模机器人学习机器人操控条件扩散条件生成概率流模仿学习模型扩展模态对齐深度估计深度图控制深度学习混元3D混合专家模型潜在扩散模型点云条件生成状态空间模型生成式 AI生成式AI确定性采样视觉定位视觉指令微调视觉理解视觉生成视觉语言动作模型视觉语言模型视觉语言预训练视角自适应视频压缩视频生成神经渲染神经辐射场稀疏激活稠密匹配纹理合成线性注意力结构化潜在表示结构化高斯腾讯自注意力艺术家风格计算机图形学计算机视觉语义压缩语言模型轨迹视图辐射场边缘检测连续潜在空间逆向过程选择性扫描选择性状态空间锚点长序列建模隐式模型零样本分类零样本迁移非马尔可夫高斯泼溅
站点统计
57文章
7分类
404标签

