Po co konwertować PDF na CSV, zamiast przepisywać liczby?
Tabela uwięziona w pliku PDF jest czytelna, ale bezużyteczna w niezmienionej postaci: nie da się jej posortować, przefiltrować ani wstawić do niej formuły. Ręczne kopiowanie wartości jest powolne i podatne na błędy, zwłaszcza w wyciągach, fakturach czy długich wyeksportowanych listach. Konwersja pliku PDF na CSV daje Ci surowy plik danych, w którym każdy wiersz i każda kolumna są od razu gotowe do pracy.
CSV to uniwersalny format: gdy Twoje dane są już na zewnątrz, otwierasz je w Excelu lub Arkuszach Google, aby podsumować liczby, porównać serie czy zbudować wykres, i równie łatwo importujesz je do bazy danych, pakietu księgowego czy narzędzia analitycznego. Wyodrębnienie tabeli z pliku PDF w ten sposób oszczędza Ci wszelkiego przepisywania i utrzymuje liczby wierne źródłu.
Jak wykrywane są kolumny (i przypadek zeskanowanego PDF)
Wykrywanie opiera się na tym, jak rozmieszczony jest tekst: pola oddzielone dwiema lub większą liczbą spacji albo tabulatorem są odczytywane jako osobne kolumny. Innymi słowy, czysto wyrównana tabela daje najlepsze rezultaty, natomiast nierówny układ może scalić kolumny i wymagać drobnego uporządkowania w Twoim arkuszu kalkulacyjnym.
Uczciwa uwaga: zeskanowany lub sfotografowany plik PDF jest jedynie obrazem, bez rzeczywistego tekstu do podziału na kolumny. Przepuść go najpierw przez narzędzie ocr, które odbudowuje faktyczny tekst, przed rozpoczęciem wyodrębniania. Jeśli chcesz prozy zamiast danych, narzędzie pdf-to-word pasuje lepiej, a narzędzie convert gromadzi pozostałe formaty wyjściowe. Jeśli chodzi o prywatność, pdfOutils pozostaje wierny zasadzie prywatności: Twoje pliki są usuwane automatycznie po przetworzeniu, a rejestracja nie jest wymagana.