2025

163 posts

适配层

GPT-3/4 这样的大型语言模型,展现出了一种惊人的新能力: 1. 零样本学习 (Zero-shot):不需要给它任何范例,**只需用自然语言清晰地描述任务**,它就能直接执行。 2...

assignment 4

注意力权重 $α_i$ 是通过对 $k_i^T q$ 的点积结果进行 softmax 计算得到的。要让 $α_j$ 几乎承载所有权重,查询向量 $q$ 和键向量 $k_j$ 的点积 $k_j^T q$ 远大于所有其他点积 $k_i^T q$($i ≠ j$)。 根据 $i$ 的结论,我们有 $α_j \approx 1$ 且对于所有 $i ≠ j,α_i ≈ 0$。此时: $$ c...

微调

指令微调是收集大量**覆盖不同任务的 (指令, 输出) 数据对**,然后用这些数据去微调一个已经预训练好的语言模型(LM)。 > 一个重要的发现是,我们可以利用一个非常强大的模型(如GPT-4)来生成大量的指令和回答,然后用这些生成的数据去微调一个规模小一些的开源模型。 > 对齐,“少即是多” (Less Is More for...

预训练

预训练的目的是确保模型能**处理大规模、多样化的数据集**。我们需要在架构和工程上做好准备,让模型能够“吃得下”并且“消化得了”这种级别的数据。 在预训练中,为了实现大规模的训练,我们需要放弃昂贵且有限的人工标注数据,**采用自监督学习,让模型直接从海量的、无标注的原始文本中自我学习**。 传统模型对**词汇表(Vocabulary)** 有如下的假设: 1. ...

Transformer 架构

我们可以将注意力机制(Attention)理解为一个过程,它模仿了我们**从一个“键值对(Key-Value)”存储中“软性地”查找信息的方式**: 1. 我们有一个查询(Query)。 2...

循环神经网络

语言模型的主要任务是计算**一个词语序列出现的概率有多大**。一个由 $m$ 个词组成的序列 $\lbrace w_1, . , w_m \rbrace$,它出现的概率被记为 $P(w_1,...

反向传播补充

反向传播是一个高度本地化(local)的过程,可以看作是**电路中各个“门”(gate)之间的通信**: <Image src={image_image} alt="alt text" /> 电路中的每一个“门”(比如一个加法门、一个乘法门)在工作时,完全不需要知道整个电路有多复杂,也不需要知道自己处在电路的哪个位置。它**是一个独立的、封装好的模块,只会完成自己对应的操作**。...

assignment 2

Because the true distribution of $y$ is a one-hot vector, where $y_w=0$ for all $w \neq 0$ and $w_o=1$, the summation $\sum y_w \log(\hat{y}_y)$ simplifies to $\log(\hat{y}_o)$ 我们需要求解下面这个偏导数: $$...

依存句法分析

> 生成:Gemini-2. 5-pro, 整理:fyerfyer - 关系:依存关系是不对称的,**一个词是核心,另一个词是修饰或依附于它**。 - 我们用箭头来表示这种关系,箭头从核心词 (head) 指向修饰词 (dependent)。 - 核心词 (Head):也被称为“支配者 (governor)”,是被修饰的词。 - 修饰词 (Dependent):也被称为“从属...

依存句法分析中的增量性

在最严格的意义上,增量性指的是:在句法分析的任何一个时间点,**对于已经处理过的输入部分,我们都能得到一个单一的、连通的结构来表示其分析结果**。 最基本的基于依存句法的分析包含移入 (Shift)、左向规约 (Left-Reduce) 和 右向规约 (Right-Reduce)三个基本动作: - 左向规约:处理栈最顶端的两个词 $w_i$ 和 $w_j$。它会创建一个依存关系,让顶端的词...