惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 聂微东
C
Cisco Blogs
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
MyScale Blog
MyScale Blog
云风的 BLOG
云风的 BLOG
人人都是产品经理
人人都是产品经理
The GitHub Blog
The GitHub Blog
月光博客
月光博客
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 三生石上(FineUI控件)
V
Vulnerabilities – Threatpost
博客园 - Franky
A
Arctic Wolf
T
Tenable Blog
P
Privacy & Cybersecurity Law Blog
雷峰网
雷峰网
Blog — PlanetScale
Blog — PlanetScale
C
CERT Recently Published Vulnerability Notes
Spread Privacy
Spread Privacy
Latest news
Latest news
小众软件
小众软件
Google DeepMind News
Google DeepMind News
IT之家
IT之家
量子位
U
Unit 42
T
Threatpost
I
InfoQ
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
G
GRAHAM CLULEY
K
Kaspersky official blog
T
Tor Project blog
Scott Helme
Scott Helme
AWS News Blog
AWS News Blog
Hugging Face - Blog
Hugging Face - Blog
PCI Perspectives
PCI Perspectives
N
Netflix TechBlog - Medium
Martin Fowler
Martin Fowler
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Recent Commits to openclaw:main
Recent Commits to openclaw:main
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
V
Visual Studio Blog
S
Securelist
L
LINUX DO - 热门话题
Apple Machine Learning Research
Apple Machine Learning Research
Cisco Talos Blog
Cisco Talos Blog
D
Darknet – Hacking Tools, Hacker News & Cyber Security
C
CXSECURITY Database RSS Feed - CXSecurity.com
S
Schneier on Security
D
DataBreaches.Net

StudyingLover's Blog

Diffusion Policy笔记 rwkv笔记 act笔记 nanovllm-block_manager opencode多智能体 nanobot-pre-train nanobot-rl nanobot-sft nanobot-checkpoint_manager nanobot-gpt nanobot-mid-train Vision Mamba (Vim)笔记 BPE演示 最后一遍学习Transformer YOLOv5 目标检测笔记 下载根服务器解析记录 Dynaseal A Backend-Controlled LLM API Key Distribution Scheme with Constrained Invocation Parameters 判断链表有环 王道25数据结构勘误 关于perplexity的open-sourcing-r1-1776 AI为什么不像人类一样进行多轮对话 新博客改造日记和功能测试 linuxqq只显示登陆背景图 数字设计和计算机体系结构(机械工业出版社)勘误(自制) Dynaseal:面向未来端侧llm agent的llm api key分发机制 A Definitive Guide to Markdown Style This post is using MDX, Where you can embed JSX and Astro components RT-Patch学习 pydantic实现的LLM ReAct fastapi 和 uvicorn 设置监听 ipv6 pydantic+openai+json 控制大模型输出的最佳范式 解决 Matplotlib Scatter 不支持 Marker 列表的问题:mscatter 实现 roofline model zhipuAI接口兼容openai 在docker部署fastapi宝塔里使用nginx反代套上cloudflare获取请求的真实ip clion搭建libbpf-bootstrap开发环境 coze+coze-discord-proxy+ChatNextWebUI实现AI自由 安卓内核时间使用的是UTC时间 colab运行google最新开源模型Gemma Sora技术报告 视频生成模型作为世界模拟器 笔记 archlinux flutter开发踩坑 fastapi集成google auth登录 linux下NTFS磁盘报错输入输出错误 Venn-Abers 预测器 基于Venn-Abers预测器的系统日志异常检测方法_顾兆军 手机平板远程访问kvm虚拟机的windows phi-2弱智吧测评 poe的gemini pro或是百度开发 google gemini api使用 google gemini api申请 构建用于复杂数据处理的高效UDP服务器和客户端 matplotlib中文字体渲染 TruFor笔记和代码复现 深入分析:GitHub Trending 项目 "multipleWindow3dScene" pua大模型 ggml教程|mnist手写体识别量化推理 xgboost2.0最佳实践 xgboost使用GPU最佳实践 马踏棋盘 cloudlflare推理llama2 docker搭建elasticsearch并使用python连接 FreeU-文字生成图片的免费午餐笔记 使用xgboost的c接口推理模型 Archlinux使用CMake调用xgboost的c接口 m2cgen生成机器学习c语言推理代码 xgboost模型序列化存储并推理 speculative-sampling笔记 prompt2model笔记 RoboTAP笔记 自建obsidian同步服务 MediaPipe即将推出图像生成服务 Dual-Stream Diffusion Net for Text-to-Video Generation笔记 ViT在DDPM取代UNet(DiT) arch4edu搞崩了我的flutter LISA(推理分割)笔记 在终端绘制GPU显存使用曲线 GPTBot介绍 arch蓝牙无法连接 GPU部署llama-cpp-python(llama.cpp通用) 花式求GCD 使用llama构建一个蜜罐(前端) 使用llama构建一个蜜罐(后端) llama-cpp-python快速上手 快速上手llama2.c(更新版) DINO-v2笔记 快速上手llama2.c AnyDoor笔记 Archlinux安装scrcpy加载共享库出错 error while loading shared libraries:libusb-1.0.so.0:wrong ELF class:ELFCLASS32 npc_gzip笔记 python调用c++函数 Filesystem type ntfs3,ntfs not configured in kernel open_clip编码图像和文本 PicGo配置CloudflareR2图片储存 ArchlinuxGnome快捷键打开终端 clip-interrogator代码解析 GroundingDINO安装报错解决 2023华为鲲鹏畅想日暨西安高新国际会议中心零食午饭测评 RoboMaster开源仓库汇总(长期更新) 没有手都可以在腾讯云创建镜像 I3D笔记
Paper Gestalt笔记
About the Author StudyingLover · 2023-07-27 · via StudyingLover's Blog

Paper Gestalt笔记

最近读到了一篇CVPR2010非常优秀的论文,叫做Paper Gestalt ,他考虑到近年来(2010年的近年来)CVPR的投稿两出现了大量增长,但是作者很可能接触到一个不优秀的审稿人,所以训练了一个视觉分类器来判断一篇CVPR的论文是否应该被接受来辅助审稿。当然模型效果非常优秀了,在误分类15%的goog paper (应该被接受)的情况下可以筛选掉50% bad paper。

在这项工作中,作者构建了一种简单的直觉,即一篇论文的质量可以通过浏览总体的视觉效果来估计,并使用这种直觉来构建一个系统,该系统使用基本的计算机视觉技术来预测论文是否应该被接受或拒绝。这个任务中具有判别能力的视觉特征集就被称为Paper Gestalt。

最有意思的一点是,作者训练出来的默认为认为他的论文有88.4%的可能被接受。

作者将这个任务认为是一个二分类任务{(x1,y1),(x2,y2),...(xn,yn)}\{(x_1,y_1),(x_2,y_2),...(x_n,y_n)\} ,其中xix_i 是一个图片的视觉特征,yiy_i 则是对论文的一个标签。

给定一篇论文的图像,需要计算可插入分类系统的视觉特征的数量。作者选择了一些标准的计算机视觉特征来捕捉渐变、纹理、颜色和纹理信息。特别是作者是基于LUV直方图、直方图的定向梯度和梯度幅度来计算特征。

作者选用了AdaBoost作为分类器,公式是h(x)=∑t=1Tαtht(x)h(x)=\sum_{t=1}^T\alpha_th_t(x) hth_t就是一个弱分类器,这里选用的是决策树ht(x)=1[ft(x)>θ]h_t(x)=\mathbf{1}[f_t(x)>\theta] ,θ\theta 是阈值,ftf_t 是图像特征,整体的训练流程如图所示。(实话实话,对于我这种2020年才接触深度学习的人来说AdaBoost真的是老古董技术了(ง •̀_•́)ง,只在计算机视觉课上听过这种技术用于人脸检测) image.png

AdaBoost有许多吸引人的理论特性。例如,众所周知,经验误差是有界的ϵ(h)≤∏t=1T2ϵt(1−ϵt)\epsilon(h)\leq\prod_{t=1}^T2\sqrt{\epsilon_t(1-\epsilon_t)} 虽然这个公式摆在这没有任何用,但是作者发现数学公式多了有利于论文被接受,所以他又摆上了 Maxwell’s equations ∮E⃗⋅dA⃗=Qencϵ0∮B⃗⋅dA⃗=0∮E⃗⋅ds⃗=−dϕBdt∮B⃗⋅ds⃗=μ0ϵ0dϕEdt+μ0ienc\begin{array}{rcl}\oint\vec{E}\cdot d\vec{A}&=&\frac{Q_{enc}}{\epsilon_0}\\&&\\\oint\vec{B}\cdot d\vec{A}&=&0\\&&&\\\oint\vec{E}\cdot d\vec{s}&=&-\frac{d\phi_B}{dt}\\\oint\vec{B}\cdot d\vec{s}&=&\mu_0\epsilon_0\frac{d\phi_E}{dt}+\mu_0i_{enc}\end{array} 哦你问视觉分类器跟Maxwell’s equations 到底有啥关系?这就是这篇论文的结论部分了,作者使用了一些论文作为例子分析了效果。 image.png image.png 我们从作者给出的图可以发现,一篇被接受的论文有数学公式,有图表还有图像,而被拒的论文有令人困惑的大表格,缺少页数还有缺少五颜六色的图片。

说到令人困惑的大表格不知道你有没有想到一篇论文,对就是我们巨有钱的OPENAI做的CLIP。这表格属实看的人眼睛疼,被显卡的钱亮瞎了狗眼。 image.png

 作者还不忘了夸一下他的论文,说他的固然存在缺页/空白页的问题,但其色彩斑斓的图表和令人印象深刻的数学公式构成非常漂亮。问题是你这图也不对呀,有的图片位置都和最终论文不一样。  image.png

还有一点需要指出的是,作者的模型分析一篇论文只需要0.5秒。

在我找原文的时候,我发现arXiv上挂了一篇18年的文章Deep Paper Gestalt ,据说他训练的模型把自己拒掉了。按照这个趋势我是不是可以搞一篇论文叫做Paper Gestalt with Latent Space?