Miért érdemes egy PDF-et CSV-vé alakítani ahelyett, hogy újragépelné a számokat?
Egy PDF-be szorult táblázat olvasható, de úgy, ahogy van, használhatatlan: nem rendezheti, nem szűrheti és nem tehet bele képletet. Az értékek kézi másolása lassú és hibalehetőségekkel teli, különösen kivonatoknál, számláknál vagy hosszú exportált listáknál. Egy PDF CSV-vé alakítása nyers adatfájlt ad a kezébe, ahol minden sor és minden oszlop azonnal kész a munkára.
A CSV univerzális formátum: amint az adatai kint vannak, megnyitja őket Excelben vagy Google Sheetsben számok összegzéséhez, sorozatok összehasonlításához vagy diagram készítéséhez, és ugyanolyan könnyen importálja egy adatbázisba, egy könyvelőprogramba vagy egy elemzőeszközbe. Ha így nyer ki egy táblázatot egy PDF-ből, megkíméli magát minden újragépeléstől, és a számok hűek maradnak a forráshoz.
Hogyan észlelhetők az oszlopok (és a beszkennelt PDF esete)
Az észlelés a szöveg elrendezésén alapul: a két vagy több szóközzel, illetve tabulátorral elválasztott mezők külön oszlopként olvasódnak be. Más szóval egy tisztán igazított táblázat adja a legjobb eredményt, míg egy egyenetlen elrendezés összevonhatja az oszlopokat, és egy kis rendrakást igényelhet a táblázatkezelőjében.
Egy őszinte megjegyzés: egy beszkennelt vagy lefényképezett PDF csak egy kép, valódi szöveg nélkül, amelyet oszlopokra lehetne bontani. Előbb futtassa át az ocr eszközön, amely valódi szöveget épít újra, mielőtt elkezdi a kinyerést. Ha adat helyett prózát szeretne, a pdf-to-word eszköz jobban illik, a convert eszköz pedig összegyűjti a többi kimeneti formátumot. Az adatvédelemet illetően a pdfOutils adatvédelem-központú marad: fájljait feldolgozás után automatikusan töröljük, és semmilyen regisztráció nem szükséges.