Cosas Interesantes

Mostrando entradas con la etiqueta Adobe ACROBAT. Mostrar todas las entradas
domingo, 14 de febrero de 2010

Cómo retocar con RegEx la conversión CALIBRE desde el formato PDF y conseguir mejores ebooks en ePUB para Mi reader PAPYRE 6.1 (Cap.02)

Coco profesorEn el capítulo anterior habíamos pedido ayuda a Coco para que nos enseñara cómo arreglar los errores que se producen en la conversión de un archivo PDF hacia ePUB en CALIBRE.
Vamos a continuar utilizando RegEx para retocar el texto paraPAPYRE STREET conseguir un archivo ePUB sin errores.

ARREGLANDO LOS ERRORES MÁS HABITUALES
Los errores más habituales tienen que ver con la interrupción del flujo de texto, partiendose frases y párrafos en donde no procede.

Párrafo interrumpido por un RETORNO DE CARRO:
Retorno de carro Vemos como la frase se corta y empieza un nuevo párrafo.
La expresión de búsqueda será:
CLICK para CODE  
20091020009

He incluido las vocales acentuadas con la expresión “\()
20091020008 La expresión de sustitución es: \1 \3 Es decir, la última letra del primer párrafo, un espacio y la primera letra del segundo párrafo.
Además de seleccionar el check de “Match Case” para asegurar la diferenciación entre MAYUSCULAS y MINUSCULAS, conviene seleccionar “Minimal Matching” que asegura que se seleccionan los “segmentos” de texto más pequeños de todos aquellos que cumplen la condición de búsqueda.
Pulsamos ENTER y ¡Voilá!…
20091020010 
Carácteres espúreos al final de una frase:
CARACTERES ESPÚREOS Son números, correspondientes a la paginación del archivo PDF. En este caso, la expresión de búsqueda es sencilla:
20091020012  
Buscamos un bloque de entre 1 y 3
números (el libro no tiene más de 999 páginas) situado entre un punto “.” con un espacio detrás y una etiqueta de cierre de párrafo.
Lo sustituimos simplemente por un punto “.” seguido de la etiqueta de cierre de párrafo.
Pulsamos ENTER y “Abra-ca-dabra”…

CORREGIDO 
MÁS párrafos interrumpidos por un RETORNO DE CARRO
20091020014 ¿Pero NO HABIAMOS RESUELTO ESTE TIPO DE ERROR antes? preguntareis. Pues sí, pero NO. Porque en la expresión de búsqueda anterior no incluimos caracteres especiales cómo la coma “,” y la interrogación “¿”. Así pues nos queda cubrir los casos en los que intervienen estos caracteres que son escasos pero que en un libro de 300 y pico páginas pueden darse cerca de 50 veces. Lo resolvemos sin necesidad de RegEx, simplemente copiando la cadena a sustituir:
20091020015  Le damos al ENTER y ¡Zas!…
20091020016 
Parrafos interrumpidos por un RETORNO DE CARRO después de un guión largo
CON GUIÓN LARGO Al incluir otro tipo de carácter especial, el guión largo “” (EM Dash) también se escapó de la primera expresión de sustitución. A veces no queda más remedio que realizar este tipo de depuración “por capas de cebolla”, desde lo más general hasta los casos particulares. Aquí la expresión de búsqueda es más compleja:
CLICK para CODE
20091020018Como siempre en este caso, debemos marcar el check de “Match Case” para asegurarnos de discriminar entre MAYUSCULAS y MINUSCULAS. Pulsamos ENTER para ver la magia de RegEx en acción:
RESUELTO 
Parrafos interrumpidos por un RETORNO DE CARRO después de un guión largo cuando es un COMIENZO de FRASE
20091020020 

Ya sólo nos queda por resolver el caso más enrevesado y dificil de diferenciar del texto correcto. Es cuando después de guión largo “” (EM Dash) se rompe el párrafo; y el primer carácter del párrafo siguiente es una MAYÚSCULA, lo cual hace que sea muy dificil de distinguir de un principio de frase legítimo.
Tendremos como expresión de busqueda:


CLICK para CODE
20091020021OJO! con el “Match Case” y “Minimal Matching”; Pero aquí el truco para comprobar que efectivamente se ha roto la frase de forma incorrecta es que existe un punto “.” justo antes del guión largo “” (EM Dash); lo que indica que el mismo es el primer caracter de una nueva frase y no el último de la corriente.
Como siempre despúés de pulsar ENTER:
20091020022 
Los casos que hemos resuelto con estos retoques han eliminado cerca de 800 errores del texto, lo que supone la diferencia entre un ebook decente y una chapuza.

sábado, 13 de febrero de 2010

Cómo retocar con RegEx la conversión CALIBRE desde el formato PDF y conseguir mejores ebooks en ePUB para Mi reader PAPYRE 6.1 (Cap.01)

Coco profesorCómo seguramente ya sabréis, el formato PDF es uno de los más complicados a la hora de conseguir buenos resultados en la conversión hacia otros formatos, como ePUB. Sin embargo, PDF ha sido y sigue siendo, el formato estándar de facto para los documentos facsímiles de contenidos en papel. Por ello, muchas veces no nos quedará otro remedio que partir de un PDF para la creación de nuestro ebook en otro formato. Y hemos pedido ayuda a Coco para que nos muestre cómo mejorar los resultados obtenidos en la conversión.

CÓMO REALIZAR LA CONVERSIÓN DESDE PDFPAPYRE STREET
Existen herramientas para pre-procesar el archivo PDF y conseguir un mejor resultado en la conversión, y hablaremos de ellos en alguna otra entrada. Sin embargo, los resultados obtenidos suelen ser bastante irregulares; por lo que generalmente procedo sin más a convertir el archivo en CALIBRE, sin más; y luego retoco el resultado. Porque en cualquier caso, para conseguir un ebook decente en el formato de destino, es inevitable pasarlo por una fase de pos-proceso. En este caso, el ebook que vamos a utilizar para los ejemplos (“La nave de un millón de años” de Poul Anderson, que tenéis en la BIBLIOTECA), fue preprocesado en ADOBE ACROBAT PROFESIONAL, recortando el extremo inferior de las páginas para eliminar los números de página; y se realizaron otras operaciones para intentar eliminar lo más posible códigos que contaminaran el flujo del texto. Pero cómo comprobareis a continuación, las operaciones de preproceso no produjeron el resultado deseado. 
Sin embargo, es interesante recordar un parámetro que puede mejorar el output final en CALIBRE, asegurando la integridad de las frases y párrafos, evitando que aparezcan cortadas sin venir a cuento:

Click para IMAGEN Como se muestra en la imagen, en el apartado de ENTRADA PDF podemos jugar con el parámetro “Factor para unir líneas divididas”. Nos encontraremos menos líneas divididas si reducimos el valor por defecto de 0,5 (la longitud más frecuente de frase dentro del texto) a 0,25 ó 0,30.

PERO AL FINAL TOCA RETOCAR EL TEXTO…
Abrimos el texto en nuestra herramienta de pos-prensa preferida, SIGIL y encontramos varios tipos de errores en el texto convertido:

Números de página o de título partiendo un párrafo:
20091020002 Esto se produce por la confusión entre el contenido de los pies de página y el texto en el archivo PDF. Y queda HORRIBLE. Para subsanarlo aprovecharemos nuestros (escasos) conocimientos de RegEx (Expresiones Regulares) y preparamos una expresión de búsqueda que seleccione todas las ocurrencias de este error en el texto:
20091020003
Necesitamos encontrar “un espacio seguido de un número al lado de una etiqueta de fin de párrafo que a continuación tenga una marca de inicio de párrafo seguida de una palabra que comienza por minúscula”.


image 
servirá para seleccionar todas las ocurrencias en el texto. Pero OJO! habrá que marcar el check “Match Case” para distinguir entre mayúsculas y minúsculas, ya que el signo distintivo de este error es que el segundo párrafo empieza por MINUSCULA, quedando claro que es una frase que se ha partido por la mitad.


La expresión de reemplazo es sencilla:
20091020004 \2

para indicar que queremos reemplazar por el segundo grupo de “caracteres variables”, en este caso la letra inicial de la primera palabra del segundo párrafo.
Le damos a ENTER y ¡ale-hop!…
20091020005 20091020006


De un golpe hemos arreglado 153 errores en el texto. Y como esta entrada ya está quedando un poco larga, continuaremos con más ejemplos en el próximo capítulo.

martes, 24 de noviembre de 2009

El PAPYRE 6.1 y el DRM: leyendo tus libros protegidos en formato MOBI y PDF-EPub

DRM

He visto que un lector buscaba información sobre la situación de los ebooks con DRM con respecto al PAPYRE 6.1



¿QUE ES DRM?

La Gestión de derechos digitales o DRM (digital rights management) es un término genérico que se refiere a las tecnologías de control de acceso usadas por editoriales y dueños de derechos de autor para limitar el uso de medios o dispositivos digitales. También se puede referir a las restricciones asociadas a instancias específicas de obras digitales o dispositivos. Los DRM se traslapan con la protección de copia de software hasta cierto punto, aunque, el término DRM es generalmente aplicado a medios creativos (música, películas, etc.) mientras que el término "protección de copia" tiende a referirse a los mecanismos de protección de copia en software computacional.
En resumidas cuentas, es la tecnología que intentará evitar que compartas y propagues un e-book comprado, asegurándose que eres el comprador o de otra manera, impidiendo la reproducción del mismo.

DRM EN EL PAPYRE 6.1 

Las versiones del firmware ANTERIORES a la 2.10 soportaban ficheros MOBI con DRM, pero a partir de esa versión se incluyó el software ADOBE DIGITAL EDITIONS como lector de los ebooks en formato PDF y EPub, con DRM; y se abandonó el DMR para MOBI.
¿Por qué?
Pues simplemente porque AMAZON compró para su KINDLE al fabricante creador del formato MOBI. Y exige exclusividad para la gestión de DRM en MOBI. Si quieres montar en tu dispositivo un lector de MOBI o sólo deberá leer en abierto o tu dispositivo sólo podrá leer DRM de MOBI y de ningún otro formato.
Es una cuestión COMERCIAL.

COMO ABRIR TUS PDFs y EPubs con DRM o PROTEGIDOS CON CONTRASEÑA



- Método “Casero”
Supongamos que tienes un libro llamado “ElQuijote.PDF”. Abres un editor de texto (tipo NOTEPAD) y creas un archivo llamado “ElQuijote.PWD” y en su interior tecleas la contraseña de apertura del archivo PDF.
Debes copiar tu archivo de contraseña PWD en el mismo directorio donde alojes el documento en PDF

- Método “Elegante”
Esto NO LO HE PROBADO pero debería funcionar. Si tienes instalado en tu PC el ADOBE DIGITAL EDITIONS, y has incorporado a tu librería el archivo protegido, podrás gestionar el DRM desde la consola del ADE. Si abres el archivo en el ADOBE DIGITAL EDITIONS del PC y te conectas a tu PAPYRE 6.1 desde el programa, debería ser posible subir al reader una versión del libro desprotegida para nuestro dispositivo.

20100625
JoseLuis nos confima que el “método elegante” funciona correctamente. Aconsejo tener instalada la version de ADE más reciente.
En vista de algunas consultas recibidas reproduzco el proceso de conexión automática con el PC. Esto es lo que teneis que ver en vuestra pantalla de forma automática.

  




miércoles, 28 de octubre de 2009

Manejando e-books PDF Adobe en mi PAPYRE 6.1 (Parte 05)

Probado con este FIRMWAREPAPYRE 6.1Continuando con lo que comentábamos en Leyendo en nuestro PAPYRE 6.1 libros-electrónicos en formato PDF de Adobe Acrobat. (Parte 04) sólo nos queda examinar la NOVEDAD que supone la funcionalidad “7. Búsqueda”.
Ver la IMAGEN Cuando la seleccionamos aparece en la parte inferior de la pantalla un teclado soft estilo teléfono mediante el que podemos introducir los términos a buscar. El manejo no es para los torpes de dedos ya que a veces es difícil distinguir entre “carácter siguiente de la misma tecla” y “nuevo carácter”. Los que hayáis compuesto SMS con un móvil normal sabéis de lo que hablo.
Una vez tecleado el término a buscar, pulsamos OK  y el PAPYRE 6.1 entra en modo de búsqueda y presenta la primera ocurrencia:
Formato PDF en PAPYRE020
Podemos elegir entre salir del modo de búsqueda pulsando CANCEL  o ir hacia la siguiente ocurrencia con OK:
Formato PDF en PAPYRE021
Si pulsamos cualquier otra tecla un mensaje de error nos pide que pulsemos CANCEL para volver al modo normal.

20091030 MODIFICACIÓN

La búsqueda ha encontrado el término de busqueda sin distinguir entre mayusculas y minusculas. No puede ser de otra forma ya que la opción “case insensitive” estaba marcada por defecto. No he sido capaz de encontrar el modo de seleccionar/deseleccionar esta opción.
Para terminar con las opciones del MENÚ queda la opción “8. Acerca de..” que nos muestra la información sobre el documento, su ficha técnica.

Cómo leer mis libros electrónicos (e-books) PDF en un lector PAPYRE 6.1 (reader) . Parte 03

Probado con este FIRMWAREPAPYRE 6.1En  Leyendo mis libros electrónicos PDF en el PAPYRE 6.1 reader (Parte 02) empezamos a navegar por el libro, y ahora por fín, vamos a ponernos a leer.

EL ZOOM: FUNDAMENTAL PARA UNA LECTURA CONFORTABLE
Pulsa para verComo recordareis el e-book queAdobe ACROBAT PDF estabamos usando tenía un tamaño de página DINA4 por lo que se hace necesario cambiar el tamaño de la letra. Para ello, pulsamos  MENU – ZOOM:
Y el lector nos presenta 5 niveles de zoom, desdeExtra-Pequeña (no zoom) hasta Extra-Grande.
Veamos el aspecto para cada nivel.

EXTRA-PEQUEÑA

Pulsa para VER  


PEQUEÑA
Formato PDF en PAPYRE010   


MEDIANA
Formato PDF en PAPYRE011 

GRANDE
Formato PDF en PAPYRE012 


EXTRA-GRANDE
Formato PDF en PAPYRE013

Como podemos ver, excepto el tamaño inicial, los demás son perfectamente legibles y cómodos para la vista. A diferencia de otros formatos el PDF es capaz de ampliar las imágenes dentro de la página.
Para mostrar con la mayor fidelidad posible la experiencia de lectura, las imágenes han sido escaneadas directamente del PAPYRE 6.1.
Continuamos en Leyendo en mi PAPYRE 6.1 reader los libros electrónicos PDF (Parte 04)

Leyendo en nuestro PAPYRE 6.1 libros-electrónicos en formato PDF de Adobe Acrobat. Parte 04

Probado con este FIRMWAREPAPYRE 6.1 Estábamos en Cómo leer los PDFs en mi reader PAPYRE 6.1 (Parte 03 de la serie) comprobando el nivel de zoom y su legibilidad. Pero, además tenemos un modo horizontal donde las cosas son un poco distintas.Formato PDF en PAPYRE004

EL MODO ROTADO
Pulsando “6. Rotar”, la pantalla gira 90º a la izquierda presentándose en modo apaisado. Pero como la relación de aspecto de la pantalla en horizontal es ligeramente distinta a la relación en posición vertical, esto hace que el lector de PDFs de nuestro PAPYRE 6.1 (ADOBE DIGITAL EDITIONS) escale las fuentes. De esta forma, tenemos otros 5 niveles de zoom, ligeramente distintos que son otra opción  a la hora de leer.
Partimos del tamaño “Extra-Pequeño” y rotamos…

ROTADO EXTRA-PEQUEÑO
Pulse para ver ORIGINAL
ROTADO PEQUEÑO
Formato PDF en PAPYRE015
ROTADO MEDIANO 
Formato PDF en PAPYRE016
ROTADO GRANDE

Formato PDF en PAPYRE017
ROTADO EXTRA-GRANDE 
Formato PDF en PAPYRE018  Debemos recordar que los botones NEXT/PREV (PAG.SIGUIENTE/PAG.PREVIA) NO ROTAN SU FUNCIONAMIENTO EN RELACION A LA PANTALLA. Por ello, quedan de una forma un tanto “antinatural”. Para avanzar tenemos que dar al botón cuya flecha apunte hacia ARRIBA y para retroceder al boton que apunte hacia ABAJO. Ocurre lo mismo con los botones numéricos 9/0.

Continuamos en Manejando e-books PDF en mi reader PAPYRE 6.1

© Cosas Interesantes