AI alapú PDF anonimizáló és adatkinyerő rendszer
Egy olyan egyedi fejlesztésű, mesterséges intelligencia alapú PDF anonimizáló és adatkinyerő platformot készítettünk, amely lehetővé teszi a szervezetek számára, hogy érzékeny dokumentumaikat gyorsan, biztonságosan és automatizált módon dolgozzák fel. A rendszer ideális olyan vállalatok, egészségügyi intézmények, jogi irodák, biztosítók és közigazgatási szervezetek számára, ahol nagy mennyiségű személyes vagy bizalmas adatot tartalmazó PDF-ek kezelése mindennapos feladat.
A platform elsődleges célja a GDPR-kompatibilis PDF anonimizálás, az AI-alapú adatkinyerés, valamint a dokumentumok álnevesítése, mindezt emberi beavatkozás minimalizálásával és nagy feldolgozási sebességgel.


Intelligens PDF anonimizálás mesterséges intelligenciával
A rendszer kétféle anonimizálási lehetőséget kínál.
Az interaktív PDF-megjelenítőben a felhasználó manuálisan is kijelölheti az eltakarandó adatokat, így teljes kontrollt kap a folyamat felett.
Automatikus feldolgozás esetén viszont egy nagy nyelvi modell (LLM) előre definiált séma alapján felismeri és kitakarja az érzékeny adatokat, például:
- nevek
- lakcímek
- születési dátumok
- telefonszámok
- e-mail címek
- személyazonosító adatok
- bármilyen egyedi mező, amelyet a séma meghatároz
Ennek köszönhetően akár több ezer dokumentum is feldolgozható rövid idő alatt, mindezt manuális munka nélkül.
Strukturált adatkinyerés PDF dokumentumokból
A platform nemcsak anonimizálni képes, hanem strukturált adatokat is képes kinyerni PDF-ekből.
A felhasználó által definiált sémák alapján az AI automatikusan azonosítja a kívánt adatokat, majd azokat validált JSON formátumban adja vissza. A rendszer többlépcsős típusellenőrzést alkalmaz, és szükség esetén automatikusan újrafuttatja a feldolgozást, így jelentősen növeli a kinyert adatok pontosságát.
Ez különösen hasznos szerződések, egészségügyi dokumentációk, biztosítási iratok, HR dokumentumok vagy egyéb strukturálatlan PDF-ek feldolgozásakor.


Dokumentumok álnevesítése
Az anonimizálás mellett a rendszer támogatja az álnevesítést is.
Egy egyszerű CSV fájl segítségével (FROM → TO megfeleltetéssel) automatikusan lecseréli a dokumentumban található szövegeket úgy, hogy közben megőrzi az eredeti betűtípust, méretet, színezést és az oldal megjelenését. Ez ideális tesztkörnyezetek létrehozásához vagy érzékeny adatok biztonságos megosztásához.
Rugalmas sémarendszer
A platform egyik legfontosabb eleme a saját fejlesztésű sémarendszer.
A sémák határozzák meg, hogy a mesterséges intelligencia milyen adatokat keressen, milyen adattípusokat kezeljen (szöveg, szám, logikai érték, lista vagy beágyazott objektum), illetve mely mezőket kell anonimizálni.
A sémák újrafelhasználhatók, egymásba ágyazhatók, és futásidőben automatikusan validálásra kerülnek Pydantic modellek segítségével, így biztosítva a konzisztens és megbízható adatfeldolgozást.
OCR támogatás szkennelt PDF-ekhez
A rendszer automatikusan felismeri, ha egy PDF nem tartalmaz kijelölhető szöveget.
Ilyenkor OCR (optikai karakterfelismerés) segítségével digitalizálja a dokumentumot Tesseract használatával, majd ezt követően végzi el az anonimizálást vagy az adatkinyerést. Az eredeti oldalméret és dokumentumszerkezet megmarad.
Biztonságos működés
A platform tervezése során kiemelt szempont volt az adatbiztonság.
A feldolgozott dokumentumok nem kerülnek tartós tárolásra, kizárólag a működéshez szükséges tranzakciós metaadatok maradnak meg. Ez csökkenti az érzékeny adatok kezelésével járó kockázatokat, és támogatja a GDPR-követelmények teljesítését.
Token alapú használat és egyszerű bejelentkezés
A szolgáltatás token alapú elszámolást használ, ahol 1 token egy PDF-oldal feldolgozásának felel meg.
A tokencsomagok Stripe-alapú online fizetéssel vásárolhatók meg, a számlák pedig PDF formátumban letölthetők.
A bejelentkezés jelszó nélkül történik: a rendszer egyszer használatos, 6 jegyű e-mailes OTP kódot küld a felhasználónak. Az új regisztrálók 5 ingyenes tokent kapnak, így az alkalmazás azonnal kipróbálható.


Technológiák
A projekt modern AI és felhőalapú technológiákra épül, többek között:
- Frontend: SvelteKit, TypeScript, Tailwind CSS, Prisma ORM
- Backend (Python feldolgozó szolgáltatás): Python, Flask, PyMuPDF, Tesseract OCR, Pydantic
- AI / LLM: Ollama, Llama 3.2 (helyi GPU-n futó inferencia, NVIDIA CUDA)
- Adatbázis: PostgreSQL (Prisma ORM-en keresztül kezelve)
- Fizetés: Stripe (Checkout, Webhookok, számlák PDF-ben)
- Biztonság: Cloudflare Turnstile (bot védelem), OTP e-mail alapú hitelesítés (SMTP)
- Infrastruktúra: Docker, Docker Compose, Kubernetes (k8s), konténer registry
Az elkészült rendszer egy olyan vállalati szintű megoldás, amely ötvözi a mesterséges intelligencia nyújtotta automatizálást a magas adatbiztonsággal, így jelentősen csökkenti a manuális dokumentumfeldolgozás idejét és költségeit.







