AI 学习笔记

面向深度学习与表征学习的概念长文与资源索引:从嵌入、序列模型、卷积与残差网络到 Transformer,并持续收录可信赖的外部技术博客与平台入口。单篇长文多为中英双语编排(英文标题 + 中文正文或对照),可在各文顶部切换语言。

前沿模型架构

Whisper 模型结构

从 Log-Mel、音频 Encoder、Cross-Attention Decoder 到特殊 Token 与长音频滑窗,理解 Whisper 如何统一多语转写、翻译和时间戳。

语音识别

GLM-4-Voice 架构与 Streaming Thoughts

从 12.5 Hz 单码本 Tokenizer、9B 语言模型到 CosyVoice 流式解码,追踪文本与语音交错生成的完整数据流。

语音架构

RVQ:逐层残差量化

推导最近邻选择、残差递推、直通估计器和码率公式,并用完整架构图解释多码本音频 Codec。

音频 Tokenizer

Kimi-Audio 之后的新模型全景

按音频理解、直接语音生成、原生全双工、推理工具与开放性比较 2025–2026 年的新一代 Audio 模型。

Audio Foundation Model

语音基础模型的四层技术演进

从连续 SSL 表征、神经音频 Tokenizer、Speech LM 到原生语音 LLM,理解四层接口如何组合而非彼此替代。

技术演进

SAN-M 模型架构

理解自注意力与 DFSMN Memory 如何在 Value 上并行融合,以及它与 Conformer、Paraformer-v2 的结构关系。

语音编码器

Conformer 模型架构

拆解 Macaron 双 FFN、相对位置自注意力、GLU 与 Depthwise Conv 的完整数据流。

语音编码器

SiLU 与 SwiGLU FFN

Attention 输出为什么通常不接激活,以及门控、升维、逐元素乘法和降维如何组成完整 FFN。

激活与门控

HuBERT:模型架构与训练 Loss

区分完整语音的离线聚类目标与遮蔽输入的在线预测,理解伪标签来源、masked cross-entropy 和迭代训练。

语音表征

MiniMax Sparse Attention(MSA)

按 GQA group 检索 128-token KV blocks,再在 Top-16 blocks 上执行精确块稀疏注意力。

长上下文

DeepSeek Sparse Attention(DSA)

Lightning Indexer 先选择 Top-k 历史 token,Sparse MLA 再完成精确注意力。

长上下文

Attention Residuals(AttnRes)

把固定残差累加改成对历史层表示的内容相关选择,并用 Block AttnRes 控制开销。

深度混合

Stable LatentMoE

让 896 个路由专家在低维 latent space 工作,理解 896 选 16 的容量与稳定性取舍。

稀疏 MoE

IndexShare

GLM-5.2 如何让连续四层复用一次 DSA 索引,减少全长检索的重复计算。

跨层复用

MoonViT-V2

从图像 patch、视觉 Transformer、PatchMergerV2 到 Kimi K3 语言 token 的完整入口。

视觉编码器

Gated MLA

MLA 的 latent KV cache、输出门控,以及它与 KDA 交替提供全局访问的原因。

注意力机制

Kimi K3 架构

串联 KDA、Gated MLA、AttnRes、Stable LatentMoE、MoonViT-V2 与量化感知训练。

模型拆解

GLM-5.3 / GLM-5.2 架构

区分 5.3 后训练更新与 5.2 基座,拆解 MLA、DSA、IndexShare、MoE 和 MTP。

模型拆解

MiniMax M3 架构

理解 428B/23B sparse MoE、GQA + MSA、原生图像视频输入与 1M context。

模型拆解

理解混合专家模型(MoE)

从稠密 FFN 到稀疏路由:架构图、Top-k 伪代码、Sigmoid/Softmax Router,以及 DeepSeek、GLM、Kimi、MiniMax 实现对比。

模型架构

Conditional Flow Matching 与 Rectified Flow

从速度场、流映射和连续性方程出发,推导 CFM 与直线路径,并逐步计算视频 latent 的训练损失。

生成模型

视觉-语言-动作模型(VLA)

从像素、语言指令到机器人动作:统一架构、单/双系统、离散 token 与连续流匹配,以及代表模型对照。

具身智能

理解 CNN 与 ResNet

模块化卷积、退化与恒等捷径、残差块的优化动机,以及相对 Transformer 的归纳偏置与局限。

计算机视觉

当代 LLM 架构比较导读

导读 Sebastian Raschka《The Big LLM Architecture Comparison》:GQA/MLA、MoE、归一化与混合注意力等主线,附 Ahead of AI 原文链接。

架构地图

Awesome AI 博客与资源站

OpenAI 研究资讯、Distill、colah、Hugging Face、GitHub、Karpathy、Sebastian Raschka 及 DeepMind、Jay Alammar、Lil'Log 等精选信源清单。

资源索引

AI API 申请教程合集

汇总通义千问、智谱 GLM、Kimi、OpenRouter、NVIDIA NIM、MiniMax、豆包与腾讯云 ASR 的 API 申请入口。

申请入口

免费 LLM API 与 HackChance

介绍 OpenRouter、NVIDIA NIM 的免费 AI API,并说明 HackChance 如何自动选择两平台的免费模型。

免费 API

申请通义千问(Qwen)API

阿里云百炼控制台:登录与 API Key 入口、在模型用量中开通免费额度模型、创建并复制密钥用于调用。

实践

申请智谱 GLM API

智谱 AI 开放平台:登录、GLM Coding 优惠套餐与定价页、在控制台创建 API Key 用于调用。

实践

申请 Kimi(Moonshot)API

Kimi 开放平台登录、国内控制台充值与 API Key 管理,用于调用 Kimi 系列模型。

实践

申请 OpenRouter API

OpenRouter 注册登录、点击 Get API Key,并在 API Keys 页面创建与管理统一模型调用密钥。

实践

申请 NVIDIA NIM API

NVIDIA Build 登录、从账号菜单进入 API Keys,并生成用于调用 NIM 服务的 API Key。

实践

申请 ElevenLabs API

ElevenLabs 注册登录、选择使用场景,并在开发者后台 API Keys 页面创建语音 AI 调用密钥。

实践

申请 MiniMax API

MiniMax 开放平台用户中心登录与「接口密钥」管理,创建 API Key 用于调用。

实践

申请豆包(火山方舟)API

火山引擎登录、模型定价、开通管理中启用目标豆包模型、在方舟创建 API Key。

实践

获取腾讯云语音识别(ASR)API

注册与实名、开通语音识别服务、购买资源包;调用需云 API 密钥(SecretId / SecretKey)。

实践

理解 Embedding

从 one-hot 到分布式表示,梳理 Word2Vec、GloVe 以及现代 Transformer 中的嵌入思想。

表征学习

理解 LSTM 网络

从 RNN 的长期依赖问题到门控与细胞状态,图解长短期记忆网络的工作原理。

序列模型

理解 Transformer

注意力与自注意力、编码器–解码器结构,以及并行性、复杂度与局限性的概念梳理。

注意力机制