2025

163 posts

神经网络补充

生物神经元具有如下的结构: - 树突 (Dendrites):像天线一样,负责**从其他神经元那里接收输入信号**。 - 轴突 (Axon):是一条单一的输出线,负责**将处理后的信号传递出去**。 - 突触 (Synapses):是轴突的末梢和其他神经元树突的连接点,是**信号传递的关键节点**。...

深度学习自然语言处理

在之前的讨论中,我们已经明确了非线性分类器的必要性,因为**大多数数据并不是线性可分的**,因此使用线性分类器的分类性能会受到限制。 神经网络是一类**具有非线性决策边界的分类器**。 神经元是一个通用的计算单元,它接受 $n$ 个输入并产生一个输出。 一个比较常见的神经元类型是 $Sigmoid$ 逻辑单元,神经元关联着一个 $n$ 维权重向量 $w$ 和一个标量偏置 $b$,其输出为:...

GloVe模型

我们先前介绍的Skip-gram模型通过在局部上下文窗口中进行预测来学习词嵌入。这些模型展示了捕捉词语相似性的语言模式的能力,但**未能利用全局共现统计信息**。 与Skip-gram不同,GloVe使用**全局统计信息**,通过最小二乘目标函数预测词 $j$ 出现在词 $i$ 上下文中的概率。 在详细讲述GloVe模型之前,我们先声明**共现矩阵**及其相关概念。 -...

Word2vec模型

一个词(如 `tea`)是一个**符号/能指 (Signifier)**,它代表了现实或想象世界中的某个**实体/所指 (Signified)**。词义是极其复杂的,它源于人类在世界中沟通和实现目标的意图。 最简单的表示方法是将每个词视为独立的实体。在向量空间中,这通常通过 **one-hot 向量(或称标准基向量)** 来实现。 例如,在一个词汇表 $V$ 中: $$...

SVD分解简介

> 本文章适用于速通SVD分解,因此讲得不是那么详细。 > 生成:Gemini-2. 5-pro, 整理:fyerfyer 奇异值分解(SVD)是一种强大而基础的矩阵分解技术,在数据科学、机器学习和自然语言处理(NLP)等领域有广泛应用。我们可以从三个互补的角度来理解SVD: 1...

探索与利用

在强化学习中,智能体的目标是学习一个最优策略来最大化长期回报。为了达成此目标,智能体必须在两个核心行为之间做出权衡: - **探索 (Exploration)**: 尝试当前看起来并非最优的动作,目的是为了收集更多关于环境的信息,发现潜在的、更优的行动选择。 - **利用 (Exploitation)**: 执行当前已知能够带来最大回报的动作,以获取即时奖励。 **“充分的探索”**...

MDP-calculation-exercise

> In micro-blackjack, you repeatedly draw a card (with replacement) that is equally likely to be a 2, 3, or 4. You > can either Draw or Stop if the total score of the cards you have drawn is less...

基于模型的学习

在强化学习中,**基于模型的学习**(Model-Based Learning)是一种方法,其核心思想是让智能体通过与环境的交互来**学习环境的动态模型**。这个模型通常包括两个关键部分: - **转移函数 (Transition Function) $T(s, a, s')$**:预测在状态 $s$ 执行动作 $a$ 后,转移到下一个状态 $s'$ 的概率。 - **奖励函数...

无模型学习

无模型学习(Model-Free Learning)是一类无需了解环境模型(转移函数 $T$ 和奖励函数 $R$)的强化学习算法。代理**直接通过与环境的交互经验**来学习价值函数或策略。 无模型学习主要分为两大类: - **被动强化学习 (Passive Reinforcement Learning)**:代理遵循一个固定的策略...