关于我
关于本站 / About AIAttnStudio
欢迎来到 AIAttnStudio!这是一个专注于人工智能(AI)前沿技术研究、工程落地与硬核实践的个人技术博客。
🎯 博客定位与目标
本站旨在建立一个系统化、深度与广度兼备的人工智能前沿知识库。在此记录并分享 AI 领域的最新突破、经典/顶会论文深度研读、算法复现心得以及大模型与具身智能在工程落地中的实战经验。
Note
专注于探索 AGI(通用人工智能)的演进路径,以及人工智能从数字空间走向物理世界的无限可能。
🚀 核心研究与探索方向
🧠 1. 大语言模型 (Large Language Models, LLMs)
- 模型架构与演进: Transformer 架构优化、MoE (Mixture of Experts) 混合专家模型、Long Context (长上下文扩展)
- 对齐与强化: RLHF (PPO / DPO / GRPO)、SFT 指令微调、模型量化 (AWQ / GPTQ / GGUF) 与 Speculative Decoding 加速
- 高效推理与部署: vLLM, TensorRT-LLM, DeepSpeed 分布式训练与吞吐优化
👁️ 2. 计算机视觉 (Computer Vision)
- 3D 视觉与重建: 3D Gaussian Splatting (3DGS)、NeRF (神经辐射场)、三维点云处理与深度估计
- 视觉大模型 (VLM): 多模态理解 (Vision-Language Models)、OCR 与图像细粒度感知
- 前沿视觉任务: 目标检测、实时语义分割、自监督视觉预训练 (MAE / DINOv2)
🎨 3. 生成式 AI (Generative AI)
- 图像与视频生成: 扩散模型 (Diffusion Models, Stable Diffusion, Flux)、DiT (Diffusion Transformer) 架构
- 多模态可控生成: ControlNet, IP-Adapter, 视频生成 (Sora 类架构解析与可控合成)
📊 4. 强化学习 (Reinforcement Learning)
- 大模型强化学习: 基于人类与 AI 反馈的强化学习 (RLHF / RLAIF)、推理能力探索 (o1 链式思考强化)
- 经典与多智能体 RL: PPO, SAC, MARL (多智能体强化学习) 与环境模拟
🦾 5. 具身智能 (Embodied AI)
- VLA 模型: Vision-Language-Action (视觉-语言-动作) 统一具身大模型
- 机器人感知与控制: 空间智能 (Spatial Intelligence)、操作规划 (Manipulation)、Sim-to-Real 仿真实真迁移
🛠️ 6. AI Agent (智能体系统)
- 智能体架构: Single/Multi-Agent 协作机制、Memory 机制 (短期/长期记忆)
- 工具调用与 RAG: Function Calling、Tool Use、高级 RAG (检索增强生成) 与向量数据库工程
💻 常用技术栈与工具箱
- 深度学习框架: PyTorch, JAX, TensorFlow
- 大模型生态: HuggingFace Transformers, vLLM, DeepSpeed, Ollama, Peft
- Agent & RAG 框架: LangChain, LlamaIndex, AutoGen, CrewAI
- 开发与部署: Python, C++/CUDA, Docker, Ray, Triton Inference Server
Tip
保持好奇,持续探索。用代码与算法理解世界!

