Contact
QR code for the current URL

Story Box-ID: 1118417

JET-Software GmbH Edmund-Lang-Straße 16 64832 Babenhausen, Germany https://www.jet-software.com
Contact Mr Amadeus Thomas 06073-711403
Company logo of JET-Software GmbH

❌ Schutz von/in Dark Data ❌ Gezielte Datenmaskierung von Namen in unstrukturierten Quellen wie PDF, MS Office-Dokumenten, Bildern oder Textdateien ❗

NER-Modelle und Sprachen: Lösung mit der Verwendung von Named Entity Recognition wie Tensorflow- und PyTorch ❗

(PresseBox) (Babenhausen, )
Tensorflow- und PyTorch-NER-Modelle: Die Erkennung von benannten Entitäten (Named Entity Recognition, NER) ist eine Art des maschinellen Lernens (ML), um benannte Entitäten im grammatikalischen Kontext von unstrukturiertem Text (Dokumenten) zu erkennen. NER wird benötigt, um Dinge wie Personennamen und Straßenadressen zu finden, da diese weder Mustern entsprechen, noch wahrscheinlich eine Übereinstimmung mit Werten in einer definierten Liste (Lookup Set) haben.

Da es sich bei vielen Entitäten wie Personennamen oder Adressen um persönlich identifizierbare Informationen (PII) handelt, verwendet IRI DarkShield NER, um solche Daten zu finden und zu maskieren. Während die Kenntnis des Namens einer Person allein vielleicht kein allzu großes Risiko darstellt, erhöht sich in Kombination mit anderen sensiblen Daten das Risiko, dass diese Person zum Ziel von Cyberkriminellen wird, wenn der Datensatz angegriffen wird.

IRI DarkShield unterstützt bereits seit Jahren den Import und das weitere Training von OpenNLP-Modellen zum Auffinden und Maskieren von benannten Entitäten. Neu in der DarkShield RPC API 2022 ist jedoch die Unterstützung für moderne Tensorflow und PyTorch NER Modelle. Dies ist eine bedeutende Verbesserung gegenüber dem ersten Satz schneller, aber weniger NER-Modelle auf Basis von OpenNLP.

NER-Modelle, einschließlich solcher aus Quellen wie dem Hugging Face Model Hub. Allein von diesem Hub sind NER-Modelle in über 100 Sprachen verfügbar. Viele dieser Modelle nutzen die Vorteile der relativ neuen Transformer-Architektur für maschinelles Lernen, um die Trainingszeiten zu verkürzen und die Genauigkeit zu verbessern.

Um den Transformers Search Matcher mit der DarkShield-API zu verwenden, empfehlen wir ein System mit einem Grafikprozessor, um die Inferenz der meisten Modelle zu beschleunigen (in der Regel um mindestens das 20-fache). Die DarkShield-API lädt beim Start des Servers automatisch die für den Transformers-Matcher erforderlichen Abhängigkeiten herunter.

Modelle werden entweder als lokales Verzeichnis oder aus dem Hugging Face Model Hub angegeben. Bei direkter Angabe aus dem Hugging Face Model Hub sollte das Python-Skript model_util.py aus dem Ordner plankton/utils vorher ausgeführt werden, um das Modell herunterzuladen. Diesem Skript können die Argumente des Modells und des Tokenizer-Namens (oft derselbe wie der Modellname) übergeben werden.

Wir werden die Erkennung von benannten Entitäten in englischen, türkischen und japanischen Texten anhand von drei verschiedenen NER-Modellen demonstrieren, die alle im Hugging Face Model Hub verfügbar sind. Hier finden Sie den detaillierten technischen Blog-Artikel!

Weltweite Referenzen: Seit über 40 Jahren nutzen unsere Kunden wie die NASA, American Airlines, Walt Disney, Comcast, Universal Music, Reuters, das Kraftfahrtbundesamt, das Bundeskriminalamt, die Bundesagentur für Arbeit, Rolex, Commerzbank, Lufthansa, Mercedes Benz, Osram,.. aktiv unsere Software für Big Data Wrangling und Schutz! Sie finden viele unserer weltweiten Referenzen hier und eine Auswahl deutscher Referenzen hier.

Partnerschaft mit IRI: Seit 1993 besteht unsere Kooperation mit IRI (Innovative Routines International Inc.) aus Florida, USA. Damit haben wir unser Portfolio um die Produkte CoSort, Voracity, DarkShield, FieldShield, RowGen, NextForm, FACT und CellShield erweitert. Nur die JET-Software GmbH besitzt die deutschen Vertriebsrechte für diese Produkte. Weitere Details zu unserem Partner IRI Inc. hier.

JET-Software GmbH

JET-Software entwickelt und vertreibt seit 1986 Software für die Datenverarbeitung für gängige Betriebssysteme wie BS2000/OSD, z/OS, z/VSE, UNIX & Derivate, Linux und Windows. Benötigte Portierungen werden bei Bedarf realisiert.

Wir unterstützen weltweit über 20.000 Installationen. Zu unseren langjährigen Referenzen zählen deutsche Bundes- und Landesbehörden, Sozial- und Privatversicherungen, Landes-, Privat- und Großbanken, nationale und internationale Dienstleister, der Mittelstand sowie Großunternehmen.

The publisher indicated in each case (see company info by clicking on image/title or company info in the right-hand column) is solely responsible for the stories above, the event or job offer shown and for the image and audio material displayed. As a rule, the publisher is also the author of the texts and the attached image, audio and information material. The use of information published here is generally free of charge for personal information and editorial processing. Please clarify any copyright issues with the stated publisher before further use. In case of publication, please send a specimen copy to service@pressebox.de.
Important note:

Systematic data storage as well as the use of even parts of this database are only permitted with the written consent of unn | UNITED NEWS NETWORK GmbH.

unn | UNITED NEWS NETWORK GmbH 2002–2024, All rights reserved

The publisher indicated in each case (see company info by clicking on image/title or company info in the right-hand column) is solely responsible for the stories above, the event or job offer shown and for the image and audio material displayed. As a rule, the publisher is also the author of the texts and the attached image, audio and information material. The use of information published here is generally free of charge for personal information and editorial processing. Please clarify any copyright issues with the stated publisher before further use. In case of publication, please send a specimen copy to service@pressebox.de.