Sobre esta herramienta
Los PDF no guardan las imágenes como archivos JPG o PNG independientes: cada imagen se incrusta dentro del documento como un objeto interno, codificado de la forma que tuviera sentido cuando se creó el PDF. Esta herramienta profundiza en esa estructura directamente en tu navegador: recorre cada página buscando imágenes rasterizadas incrustadas, devuelve las fotos que se guardaron como JPEG idénticas byte a byte al archivo original (sin recomprimir, sin pérdida de calidad), y reconstruye un archivo PNG real y válido alrededor de cualquier dato de píxeles sin comprimir que encuentre, para que también se pueda descargar. Suelta un PDF, haz clic en "Extraer imágenes", y cada imagen que se pueda recuperar aparece como su propia miniatura con descarga de un clic.
Nada se sube a un servidor: el PDF se analiza localmente con pdf-lib, recorriendo el diccionario interno `/Resources/XObject` de cada página y distinguiendo las imágenes rasterizadas reales de los Form XObject (fragmentos de página reutilizables que no son fotos en absoluto, como las páginas incrustadas por un diseño de varias páginas por hoja o folleto), de modo que solo se extraen imágenes reales. Algunas codificaciones internas poco comunes —paletas de color indexadas, CMYK, canales de 16 bits, o compresión de fax JBIG2/CCITT usada normalmente para páginas escaneadas en blanco y negro— no se reempaquetan en un archivo descargable con esta herramienta. En lugar de adivinar píxeles que no puede decodificar correctamente, informa con honestidad las dimensiones exactas de esa imagen y la marca como codificación no compatible en vez de generar un archivo dañado.
Preguntas frecuentes
¿Por qué dice "codificación no compatible" para algunas imágenes?
Los PDF pueden almacenar imágenes usando varias codificaciones internas diferentes. Esta herramienta admite completamente las dos más comunes (imágenes codificadas en JPEG, extraídas tal cual, y mapas de bits RGB codificados en bruto/Flate, reempaquetados en archivos PNG estándar). Las codificaciones menos comunes (paletas de color indexadas, CMYK, compresión estilo fax JBIG2, o JPEG2000) se detectan; aún verás sus dimensiones y sabrás que existen, pero actualmente no se reempaquetan en un archivo descargable, para evitar adivinar datos de píxeles que no puede decodificar de forma fiable.
¿Esto encontrará imágenes que se usaron como fondo de página o marca de agua?
Sí; la herramienta escanea los recursos de imagen rasterizada incrustados en cada página independientemente de cómo se usen visualmente (una imagen de fondo de página completa, un pequeño logotipo, una foto o un bitmap de marca de agua escaneada se detectan todos de la misma manera). Lo único que omite deliberadamente son las marcas de agua basadas en TEXTO o dibujadas vectorialmente (como las que crea nuestra propia herramienta de Marca de Agua PDF), ya que se dibujan como glifos de fuente o rutas vectoriales, no imágenes rasterizadas; no hay nada que "extraer" como archivo de imagen en ese caso.