AI 学习笔记
面向深度学习与表征学习的概念长文与资源索引:从嵌入、序列模型、卷积与残差网络到 Transformer,并持续收录可信赖的外部技术博客与平台入口。单篇长文多为中英双语编排(英文标题 + 中文正文或对照),可在各文顶部切换语言。
前沿模型架构
Whisper 模型结构
从 Log-Mel、音频 Encoder、Cross-Attention Decoder 到特殊 Token 与长音频滑窗,理解 Whisper 如何统一多语转写、翻译和时间戳。
语音识别GLM-4-Voice 架构与 Streaming Thoughts
从 12.5 Hz 单码本 Tokenizer、9B 语言模型到 CosyVoice 流式解码,追踪文本与语音交错生成的完整数据流。
语音架构RVQ:逐层残差量化
推导最近邻选择、残差递推、直通估计器和码率公式,并用完整架构图解释多码本音频 Codec。
音频 TokenizerKimi-Audio 之后的新模型全景
按音频理解、直接语音生成、原生全双工、推理工具与开放性比较 2025–2026 年的新一代 Audio 模型。
Audio Foundation Model语音基础模型的四层技术演进
从连续 SSL 表征、神经音频 Tokenizer、Speech LM 到原生语音 LLM,理解四层接口如何组合而非彼此替代。
技术演进SAN-M 模型架构
理解自注意力与 DFSMN Memory 如何在 Value 上并行融合,以及它与 Conformer、Paraformer-v2 的结构关系。
语音编码器Conformer 模型架构
拆解 Macaron 双 FFN、相对位置自注意力、GLU 与 Depthwise Conv 的完整数据流。
语音编码器SiLU 与 SwiGLU FFN
Attention 输出为什么通常不接激活,以及门控、升维、逐元素乘法和降维如何组成完整 FFN。
激活与门控HuBERT:模型架构与训练 Loss
区分完整语音的离线聚类目标与遮蔽输入的在线预测,理解伪标签来源、masked cross-entropy 和迭代训练。
语音表征MiniMax Sparse Attention(MSA)
按 GQA group 检索 128-token KV blocks,再在 Top-16 blocks 上执行精确块稀疏注意力。
长上下文DeepSeek Sparse Attention(DSA)
Lightning Indexer 先选择 Top-k 历史 token,Sparse MLA 再完成精确注意力。
长上下文Attention Residuals(AttnRes)
把固定残差累加改成对历史层表示的内容相关选择,并用 Block AttnRes 控制开销。
深度混合Stable LatentMoE
让 896 个路由专家在低维 latent space 工作,理解 896 选 16 的容量与稳定性取舍。
稀疏 MoEIndexShare
GLM-5.2 如何让连续四层复用一次 DSA 索引,减少全长检索的重复计算。
跨层复用MoonViT-V2
从图像 patch、视觉 Transformer、PatchMergerV2 到 Kimi K3 语言 token 的完整入口。
视觉编码器Gated MLA
MLA 的 latent KV cache、输出门控,以及它与 KDA 交替提供全局访问的原因。
注意力机制Kimi K3 架构
串联 KDA、Gated MLA、AttnRes、Stable LatentMoE、MoonViT-V2 与量化感知训练。
模型拆解GLM-5.3 / GLM-5.2 架构
区分 5.3 后训练更新与 5.2 基座,拆解 MLA、DSA、IndexShare、MoE 和 MTP。
模型拆解MiniMax M3 架构
理解 428B/23B sparse MoE、GQA + MSA、原生图像视频输入与 1M context。
模型拆解理解混合专家模型(MoE)
从稠密 FFN 到稀疏路由:架构图、Top-k 伪代码、Sigmoid/Softmax Router,以及 DeepSeek、GLM、Kimi、MiniMax 实现对比。
模型架构Conditional Flow Matching 与 Rectified Flow
从速度场、流映射和连续性方程出发,推导 CFM 与直线路径,并逐步计算视频 latent 的训练损失。
生成模型视觉-语言-动作模型(VLA)
从像素、语言指令到机器人动作:统一架构、单/双系统、离散 token 与连续流匹配,以及代表模型对照。
具身智能理解 CNN 与 ResNet
模块化卷积、退化与恒等捷径、残差块的优化动机,以及相对 Transformer 的归纳偏置与局限。
计算机视觉当代 LLM 架构比较导读
导读 Sebastian Raschka《The Big LLM Architecture Comparison》:GQA/MLA、MoE、归一化与混合注意力等主线,附 Ahead of AI 原文链接。
架构地图Awesome AI 博客与资源站
OpenAI 研究资讯、Distill、colah、Hugging Face、GitHub、Karpathy、Sebastian Raschka 及 DeepMind、Jay Alammar、Lil'Log 等精选信源清单。
资源索引AI API 申请教程合集
汇总通义千问、智谱 GLM、Kimi、OpenRouter、NVIDIA NIM、MiniMax、豆包与腾讯云 ASR 的 API 申请入口。
申请入口免费 LLM API 与 HackChance
介绍 OpenRouter、NVIDIA NIM 的免费 AI API,并说明 HackChance 如何自动选择两平台的免费模型。
免费 API申请通义千问(Qwen)API
阿里云百炼控制台:登录与 API Key 入口、在模型用量中开通免费额度模型、创建并复制密钥用于调用。
实践申请智谱 GLM API
智谱 AI 开放平台:登录、GLM Coding 优惠套餐与定价页、在控制台创建 API Key 用于调用。
实践申请 Kimi(Moonshot)API
Kimi 开放平台登录、国内控制台充值与 API Key 管理,用于调用 Kimi 系列模型。
实践申请 OpenRouter API
OpenRouter 注册登录、点击 Get API Key,并在 API Keys 页面创建与管理统一模型调用密钥。
实践申请 NVIDIA NIM API
NVIDIA Build 登录、从账号菜单进入 API Keys,并生成用于调用 NIM 服务的 API Key。
实践申请 ElevenLabs API
ElevenLabs 注册登录、选择使用场景,并在开发者后台 API Keys 页面创建语音 AI 调用密钥。
实践申请 MiniMax API
MiniMax 开放平台用户中心登录与「接口密钥」管理,创建 API Key 用于调用。
实践申请豆包(火山方舟)API
火山引擎登录、模型定价、开通管理中启用目标豆包模型、在方舟创建 API Key。
实践获取腾讯云语音识别(ASR)API
注册与实名、开通语音识别服务、购买资源包;调用需云 API 密钥(SecretId / SecretKey)。
实践理解 Embedding
从 one-hot 到分布式表示,梳理 Word2Vec、GloVe 以及现代 Transformer 中的嵌入思想。
表征学习理解 LSTM 网络
从 RNN 的长期依赖问题到门控与细胞状态,图解长短期记忆网络的工作原理。
序列模型理解 Transformer
注意力与自注意力、编码器–解码器结构,以及并行性、复杂度与局限性的概念梳理。
注意力机制