PDF na HTML

Zamień PDF na HTML albo na Markdown i opublikuj treść dokumentu na stronie. Narzędzie odtwarza strukturę tekstu: nagłówki, akapity, listy, tabele, pogrubienia i linki, a pomija powtarzające się nagłówki, stopki i numery stron. Plik czyta Twoja przeglądarka, więc nie trafia na nasz serwer.

Ustawienia

PDF czyta Twoja przeglądarka (biblioteka pdf.js, ta sama, której używa Firefox). Plik nie jest wysyłany na nasz serwer. Odtwarzamy strukturę tekstu, a nie wygląd stron.

Po co zamieniać PDF na HTML

  • Publikacja na stronie. Raport, e-book, cennik czy informacja prasowa zapisane w PDF są wygodne do pobrania, ale źle czyta się je na telefonie i trudno z nich przejść dalej po serwisie. Ta sama treść jako strona HTML ma nawigację, linki wewnętrzne i przyciski, a tekst wklejony do CMS-a od razu ma właściwe nagłówki.
  • Newsletter i treści na blog. Fragment dokumentu zamienisz na kod, który wkleisz do edytora, zamiast przepisywać go ręcznie albo poprawiać formatowanie po kopiowaniu z czytnika PDF.
  • Praca z modelami AI. Markdown z zachowaną strukturą nagłówków i tabel to dla czatu AI czytelniejszy materiał niż tekst skopiowany z PDF, w którym wiersze są połamane, a tabele rozsypane.

Jak to działa

PDF nie przechowuje akapitów ani nagłówków, tylko pojedyncze fragmenty tekstu z ich położeniem, wielkością i krojem pisma. Narzędzie składa je z powrotem w strukturę:

  • nagłówki rozpoznaje po wielkości pisma większej niż w zwykłym tekście - największe dostają poziom H1, kolejne H2, H3 i H4,
  • akapity składa z kolejnych wierszy i łączy wyrazy podzielone na końcu wiersza. Akapit, który zaczyna się na jednej stronie, a kończy na następnej, zostaje połączony w jeden,
  • listy rozpoznaje po znakach punktorów, numerach i polach wyboru zapisanych jako tekst,
  • tabele odtwarza z wierszy podzielonych na wyrównane kolumny. Wiersz nagłówka zapisany pogrubionym krojem trafia do <thead>,
  • pogrubienie i kursywę odczytuje z nazwy kroju pisma, linki z odnośników zapisanych w pliku, a kod z pisma o stałej szerokości znaków,
  • nagłówki i stopki stron oraz numery stron usuwa, gdy powtarzają się u góry lub u dołu większości stron.

Po odczytaniu pliku zobaczysz, ile nagłówków, akapitów, list, tabel i linków udało się rozpoznać. Każde z rozpoznań możesz wyłączyć, jeśli dany dokument go nie potrzebuje, a wynik przełączyć między HTML a Markdown.

Czego narzędzie nie zrobi

  • Skany i zdjęcia stron nie zawierają tekstu, tylko obraz liter. Do ich odczytania potrzebne jest rozpoznawanie tekstu (OCR). Narzędzie wykryje taki plik i powie o tym wprost, zamiast oddać pusty wynik.
  • Wygląd stron - kolorów, czcionek, rozmieszczenia elementów i obrazków nie przenosimy. Wynikiem jest czysta struktura treści, gotowa do wklejenia w szablon Twojej strony.
  • Punktory rysowane grafiką - część programów zapisuje kropki list jako rysunek, a nie znak. Takie punkty wyjdą jako osobne akapity, bez znacznika listy.
  • Złożone tabele ze scalonymi komórkami albo z komórkami na kilka wierszy mogą wymagać poprawek. Proste tabele przechodzą bez zmian.
  • Układ w kolumnach odtwarzamy w kolejności, w jakiej tekst zapisano w pliku. Większość programów zapisuje go w kolejności czytania, ale nie wszystkie - wtedy fragmenty kolumn mogą się przeplatać.

Prywatność i pliki z hasłem

Plik odczytuje w Twojej przeglądarce biblioteka pdf.js, ta sama, której używa Firefox do wyświetlania PDF. Nie wysyłamy pliku na nasz serwer i nigdzie go nie zapisujemy. Przy pierwszym użyciu strona pobiera jednorazowo samą bibliotekę.

Jeśli PDF jest zabezpieczony hasłem, narzędzie o nie poprosi. Hasło też zostaje w przeglądarce i służy wyłącznie do odczytania pliku.

Najczęstsze pytania

Czy Google indeksuje pliki PDF?

Tak, Google potrafi zaindeksować tekst z pliku PDF i pokazać go w wynikach wyszukiwania. Strona HTML daje jednak więcej: własny tytuł i opis, dane strukturalne, linki do reszty serwisu i wygodne czytanie na telefonie. Jeśli publikujesz tę samą treść w obu formach, znacznik title i opis ustawisz tylko na stronie HTML - sprawdzisz je w szybkim audycie on-page.

Jak z wyniku zrobić dokument Word albo nowy PDF?

Plik Word z PDF pobierzesz od razu w konwerterze PDF na Word. Możesz też przełączyć wynik na Markdown i przenieść go do narzędzia Markdown na Word albo Markdown na PDF. Kod HTML ze stylami zamienisz z powrotem na PDF w narzędziu HTML na PDF.

Czy narzędzie jest bezpłatne?

Tak, bez rejestracji i bez limitu plików. Narzędzie przyjmuje pliki do 50 MB. Zobacz też pozostałe narzędzia marketingowe.