惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

WordPress大学
WordPress大学
GbyAI
GbyAI
P
Proofpoint News Feed
B
Blog
MyScale Blog
MyScale Blog
V
V2EX
B
Blog RSS Feed
Microsoft Security Blog
Microsoft Security Blog
量子位
Jina AI
Jina AI
博客园 - 叶小钗
Recent Announcements
Recent Announcements
有赞技术团队
有赞技术团队
罗磊的独立博客
L
LangChain Blog
I
InfoQ
云风的 BLOG
云风的 BLOG
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
人人都是产品经理
人人都是产品经理
小众软件
小众软件
V
Visual Studio Blog
月光博客
月光博客
The Cloudflare Blog
雷峰网
雷峰网

DEV Community

Authentication Security Deep Dive: From Brute Force to Salted Hashing (With Java Examples) Why AI Systems Don’t Fail — They Drift Spilling beans for how i learn for exam😁"Reinforcement Learning Cheat Sheet" I Replaced Chrome with Safari for AI Browser Automation. Here's What Broke (and What Finally Worked) How Python Borrows Other People's Work The $40 Architecture: Processing 1 Billion API Requests with 99.99% Uptime Vibe Coding: A Workflow Guide (From Zero to SaaS) Most webhook security guides protect the wrong side. The scary part is delivery. Headless CMS for TanStack Start: Build a Blog with Cosmic EU Age Verification App "Hacked in 2 Minutes" — What Actually Happened Comfy Cloud’s delete function does not actually remove files Running AI Models on GPU Cloud Servers: A Beginner Guide Event-driven media intelligence with AWS Step Functions and Bedrock I scored 500 AI prompts across 8 quality dimensions — here's what broke How to Call Google Gemini API from Next.js (Free Tier, No Backend Needed) The Portal Protocol: Reclaiming Human Connection in the Age of AI How to Fix Your Team's Scattered Knowledge Problem With a Self-Hosted Forum Intro to tc Cloud Functors: A Graph-First Mental Model for the Modern Cloud Designing Multi-Tenant Backends With Both Ownership and Team Access I Built a Neumorphic CSS Library with 77+ Components — Here's What I Learned PostgreSQL Performance Optimization: Why Connection Pooling Is Critical at Scale Cómo construí un SaaS multi-rubro para gestionar expensas en Argentina con FastAPI + Vue 3 🚀 I Built an Ethical Hacking Scanner Tool – Open Source Project I Replaced /usage and /context in Claude Code With a Single Statusline A Pythonic Way to Handle Emails (IMAP/SMTP) with Auto-Discovery and AI-Ready Design I Collected 8.9 Million Polymarket Price Points — Here's What I Found About How Markets Really Move EcoTrack AI — Carbon Footprint Tracker & Dashboard Everyone's Using AI. No One Agrees How. 5 self-hosted ebook managers worth trying in 2026 Building Your First AI Agent with LangChain: From Chatbot to Autonomous Assistant
CyberKB: Cómo construí una base de conocimiento de cibers...
Jose Luis Cu · 2026-05-15 · via DEV Community

Cuando empecé el Master en Ciberseguridad, tenía el mismo problema que creo que tiene todo el mundo al principio: el conocimiento se dispersa. Apuntes en Notion, PDFs en carpetas, comandos copiados en un bloc de notas, CVEs guardados en favoritos del navegador… Todo está en algún sitio, pero nunca donde lo necesitas.
Mi proyecto final fue intentar resolver eso. El resultado se llama CyberKB.
¿Qué es CyberKB?
Es una aplicación web local — corre en tu máquina, sin nube — diseñada para centralizar y organizar conocimiento de ciberseguridad mientras estudias o trabajas. El stack: FastAPI + SQLite + Claude Sonnet (Anthropic) + D3.js.
Lo que me pareció más interesante del reto fue que no quería solo un "gestor de notas con buscador". Quería que la herramienta entendiera el contenido — que supiera que una nota sobre nmap tiene que estar relacionada con reconocimiento, con TCP/IP, con enumeración de puertos — sin que yo tuviera que etiquetarlo todo a mano.
El reto técnico: hacer que la IA entienda el contexto
El módulo más complejo fue el pipeline de ingesta de documentos. El flujo es:

Subes un PDF, ODT, TXT o Markdown
Se extrae el texto (pdfplumber para PDFs, odfpy para ODT)
El texto se envía a Claude Sonnet con un prompt estructurado → Claude devuelve un JSON con categoría, resumen, tags, comandos detectados, herramientas mencionadas y CVEs
Todo se persiste en SQLite
Una segunda llamada a Claude extrae entidades (técnicas de ataque, protocolos, herramientas, vulnerabilidades…) y sus relaciones
Esas entidades alimentan el grafo de conocimiento en D3.js

Lo que más me costó fue el diseño del prompt de extracción de entidades. Las primeras versiones devolvían demasiado ruido — cualquier sustantivo técnico acababa siendo un nodo. Tuve que iterar bastante para conseguir que Claude distinguiera entre una entidad relevante para el grafo (por ejemplo, SQL Injection como técnica de ataque) y una mención de pasada que no merecía convertirse en nodo.
El módulo OSINT
Integré 15 herramientas de reconocimiento agrupadas por tipo de objetivo: dominio, IP/red, email y URL/web. Todas las consultas son asíncronas con httpx para no bloquear la interfaz mientras esperas respuesta de APIs externas.
Algunas no requieren API key (WHOIS, DNS, subdominios vía crt.sh, Wayback Machine, geolocalización IP via ip-api.com). Otras necesitan registro gratuito: Shodan, VirusTotal, Hunter.io, Have I Been Pwned.
Lo útil aquí es el historial: todos los resultados se guardan en SQLite y son accesibles desde un panel lateral. Si tres semanas después necesitas volver a ver qué subdominios tenía un dominio en un momento dado, están ahí.
El grafo de conocimiento
Esta fue la parte más visual del proyecto. Usé D3.js v7 con simulación fuerza-dirigida para renderizar las entidades extraídas por Claude como un grafo interactivo.
Hay 7 tipos de entidades, cada uno con su color:

⚔ Técnicas de ataque → rojo
🛡 Técnicas de defensa → azul
⚙ Herramientas → verde
📡 Protocolos → amarillo
⚠ Vulnerabilidades/CVEs → naranja
📋 Metodologías → violeta
💡 Conceptos fundamentales → cian

El tamaño de cada nodo refleja la frecuencia con la que aparece en los documentos. Al hacer clic en un nodo aparece un panel lateral con su descripción y las notas donde está mencionado.
Lo que me sorprendió al usarlo con mis propios apuntes fue ver los clusters que se formaban solos — cómo Metasploit, msfvenom y reverse shell gravitaban naturalmente hacia el mismo espacio del grafo junto a técnicas de post-explotación. Eso es exactamente el tipo de conexión que cuando estudias a veces no ves con claridad.
Lo que haría diferente
El mayor punto débil actual es que la extracción de entidades es costosa en tokens cuando el documento es largo. Haría chunking más inteligente antes de enviar a Claude, en lugar de mandar el texto completo. También añadiría exportación del grafo a JSON para poder importar/exportar bases de conocimiento entre instalaciones.
Conclusión
CyberKB resolvió el problema que quería resolver: tengo un sitio donde va todo el conocimiento, y ese sitio entiende lo que estoy guardando. Si eres estudiante de ciberseguridad o trabajas en el sector, el problema de la dispersión del conocimiento es real — espero que el enfoque sea útil.
El repositorio está en GitHub con instrucciones de instalación completas:
👉 github.com/Xelu94/Proyecto-Master-Ciberseguridad-Evolve-JoseLuisCuartero

Proyecto académico desarrollado durante el Master en Ciberseguridad de Evolve.