Blog
AI API设计 CTR DAPO DeepSeek-R1 GPU GRPO KV Cache Kimi-K3 LLM Mid-Training Roofline Model Serving TinyML Transformer Vibe Coding WebRTC agent ai-coding ai-infra benchmark compute-efficiency deepseek engineering-philosophy evaluation harness-engineering in-context-learning infrastructure llm methodology obsidian productivity real-time software-factory software-quality statistics vLLM web3 writing 产品策略 价值创造 健康 分布式系统 创业 后端架构 基础设施 多模态 大模型 字节跳动 工具 工程师成长 并行计算 广告 广告系统 开发 强化学习 思考 推理优化 推荐 推荐系统 支付系统 机器学习 架构 架构设计 模型压缩 深度学习 端侧推理 算力 算法 视频生成 训练 训练优化 语音AI 语音识别 量化 金钱 阅读
二十分之一的算力,凭什么只落后一年
DeepSeek 用美国 1/20 的算力做到只落后一到两年。这不是省钱,是约束迫使他们走了一条完全不同的架构路线:MoE 稀疏激活、FP8 全流程训练、自研稀疏注意力、昇腾 Day 0 适配。
关不了的灯:Software Factory 为什么必然失败
Harness Engineering 有一个结构性盲区:RL 训练缺少代码可维护性的奖励信号。这让所有试图关灯运行的 Software Factory 在 3-6 个月后被迫重新开灯。
从梯度下降到 Semantic ID:理解 RQ-VAE 所需的全部前序知识
一篇文章补齐从机器学习基础、深度学习、Transformer/LLM、搜广推系统架构到向量量化的全部知识链——读完后直接进入 RQ-VAE Semantic ID 训练那篇文章,不会有任何理解断裂。
码本利用率的骗局:RQ-VAE Semantic ID 训练的七个工程权衡
把码本向量维度改小,利用率飙到 90%+——这说明模型学好了吗?从码本崩塌到 Scaling Law,深入拆解 RQ-VAE Semantic ID 训练中的七个核心工程权衡。
GPU 推理部署学习指南:从显存计算到性能优化
给你 16GB 显存的 GPU,你能部署多大的模型?从显存计算、存储层级、Roofline Model 到量化策略,按 Bloom 认知分类法建立 GPU 推理部署的完整认知框架。
RL for LLM:为什么强化学习训练大模型这么难?
为什么 DeepSeek-R1 用 RL 能成功,但大多数学术界复现全失败?从 pass@k 的视角理解 RL 训练 LLM 的本质限制、五大失败模式和 entropy collapse 现象。
vLLM KV Cache Block Manager 深度教程
从 PagedAttention 原理到多卡部署下的 KV Cache 容量计算,彻底搞懂为什么单卡 metric 显示 52K 却能跑 200K+ 上下文。涵盖 Block Manager 架构、TP/CP 并行策略与 MLA 架构特殊性。
No matching posts found.