惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
Docker
人人都是产品经理
人人都是产品经理
小众软件
小众软件
博客园 - Franky
WordPress大学
WordPress大学
Jina AI
Jina AI
Google DeepMind News
Google DeepMind News
I
InfoQ
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
F
Fortinet All Blogs
博客园 - 【当耐特】
IT之家
IT之家
G
Google Developers Blog
J
Java Code Geeks
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
云风的 BLOG
云风的 BLOG
Recent Announcements
Recent Announcements
有赞技术团队
有赞技术团队
V
Visual Studio Blog
U
Unit 42
阮一峰的网络日志
阮一峰的网络日志
月光博客
月光博客
GbyAI
GbyAI
雷峰网
雷峰网

博客园 - 立体风

autohotkey2.0 Send keys参数分析 autohotkey2.0 盲从模式 windows 10 下 vscode 编写编译一个 nana c++ 库的示例程序 vscode 插件 cmake-tools 输出内容解读 Claude Code 处理中文乱码问题 python 启动器命令 py 答惑 windows 下 python 3.11 的版本问题 pip 安装 老版本 pytorch 的一个容易迷惑的错误 sentence transformer 例子及说明 Sentence Transformers 介绍 Jina Reranker 替代方案:改用 ModelScope 模型 Webnovel Writer 6.2.1 项目分析 windows 10 LTSC 版 安装 Terminal autohotkey2.0 脚本运行机制 windows wsl2 安装 gentoo 的步骤 windows 10 LTSC版 打开 wsl2 autohotkey 提示词 编译安装最新版 perl rust 做到“快并且安全” 的逻辑思路 rust 和 go 语言的核心目的 用 vim 查看文件的格式和编码 throughput 和 efficient 词义 python 以字符数量分割文档 (三) python 以字符数量分割文档 (二) python 以字符数量分割文档 (一) GNU Bash 参考手册(中文版)(六) GNU Bash 参考手册(中文版)(五) GNU Bash 参考手册(中文版)(四) GNU Bash 参考手册(中文版)(三) GNU Bash 参考手册(中文版)(二)
向量形式表达最小二乘法
立体风 · 2025-09-06 · via 博客园 - 立体风

数学公式 \(\min_{w} || X w - y||_2^2\) 也是表达最小二乘法,但它使用了矩阵和向量的形式,这在处理多维数据和编程时更常见、更简洁。

公式解释

这个公式的核心思想与更常见的最小二乘表示公式 \(\sum_{i=1}^{n} (y_i - \hat{y}_i)^2\) 完全一致,只是表达方式不同。

  • \(\min_{w}\): 这部分表示我们要找到一个向量 \(w\),使得后面的表达式达到最小值。这里的 \(w\) 向量包含了所有的系数(coefficients),通常写作 \(w = [w_0, w_1, \dots, w_p]^T\)。在一些表示中,为了简化,会将截距项 \(w_0\) 整合到 \(w\) 向量中,同时在特征矩阵 \(X\) 中加入一列全为1的特征。

  • \(|| \cdot ||_2^2\): 这是L2范数的平方

    • \(||\cdot||\) 代表向量的范数(Norm),可以理解为向量的“长度”或“大小”。
    • \(_2\) 表示L2范数,也叫欧几里得范数,即向量中每个元素的平方和的平方根。
    • ^2 表示平方,所以 \(|| \cdot ||_2^2\) 最终就是向量中所有元素的平方和
  • \(Xw - y\): 这是这个向量的关键部分。

    • \(X\):这是一个 特征矩阵。矩阵的每一行代表一个数据样本,每一列代表一个特征。例如,如果你的数据集有 \(n\) 个样本和 \(p\) 个特征,那么 \(X\) 的维度就是 \(n \times p\)
    • \(w\): 这是一个 系数向量,维度是 \(p \times 1\)
    • \(Xw\): 矩阵 \(X\) 和向量 \(w\) 的乘法。这正是线性模型的预测过程,它会得到一个维度为 \(n \times 1\)预测值向量,即 \(\hat{y}\)
    • \(y\): 这是一个真实目标值向量,维度是 \(n \times 1\),包含了数据集中所有样本的真实标签。
    • \(Xw - y\): 这是一个残差向量,维度是 \(n \times 1\)。向量中的每个元素都是一个样本的预测值\(Xw\) 的一个元素)与真实值\(y\) 的一个元素)之间的差值

总结

将所有部分组合起来,公式 \(\min_{w} || X w - y||_2^2\) 完整的含义是:

找到一个系数向量 \(w\),使得预测值向量 \(Xw\) 与真实值向量 \(y\) 之间的残差向量的L2范数平方(即所有残差的平方和)达到最小值。

这个公式在数学上等同于 \(\sum_{i=1}^{n} (y_i - \hat{y}_i)^2\),但它利用了矩阵运算的强大和简洁性,是现代机器学习和科学计算中最常见的表示方式。