Die Nutzung von Künstlicher Intelligenz (KI) für die Unternehmenssuche ist ein wichtiger Schritt, um Informationen leichter und effizienter zu finden. Besonders interessant ist dabei der Einsatz von selbstgehosteten Large Language Modellen (LLMs), die es ermöglichen, auf natürliche Weise mit den Daten des Unternehmens zu interagieren. Im Vergleich zu externen KI-Lösungen bietet ein selbstgehostetes Modell, wie das Nemo-Modell von Mistral, große Vorteile in Bezug auf Datensicherheit, Flexibilität und Verfügbarkeit.
Warum ein selbstgehostetes LLM?
Ein großes Problem bei externen LLMs ist die Unsicherheit über die Verfügbarkeit und Sicherheit des Dienstes. Was passiert, wenn der Anbieter plötzlich nicht mehr erreichbar ist? Unternehmen müssen sicherstellen, dass ihre Suchfunktion stets zuverlässig läuft. Dies gilt besonders für Systeme, die rund um die Uhr verfügbar sein müssen. Externe Lösungen bergen das Risiko, dass Daten bei Ausfällen vorübergehend nicht zugänglich sind. Das kann im Geschäftsalltag schwerwiegende Folgen haben. Die Abhängigkeit von einem externen Anbieter kann zu hohen Kosten und unerwarteten Verzögerungen führen. Das gilt besonders, wenn technische Probleme auftreten, die nur der Anbieter selbst lösen kann.
INTERGATOR mit einem Nemo-Modell von Mistral
Word Embeddings, Text Embeddings und die natürlichsprachige Suche
Ein wichtiger Teil der Technologie hinter INTERGATOR ist der Einsatz von Word Embeddings und Text Embeddings. Diese Techniken helfen dabei, die natürlichen Spracheingaben zu verstehen und die Bedeutung der Begriffe zu erkennen. Dadurch kann die Suchlösung in Verbindung mit dem Modell relevante Zusammenhänge erkennen und die Suchanfrage entsprechend anpassen. Zum Beispiel könnte eine Suche nach „Vertrag“ auch Ergebnisse zu „Kontrakt“ oder „Abkommen“ liefern, selbst wenn diese Begriffe nicht direkt eingegeben wurden. Diese Fähigkeit, verwandte Begriffe und Konzepte zu erkennen, macht die Suche viel flexibler und leistungsfähiger als eine einfache Schlagwortsuche.
Text Chunking für bessere ergebnisse mit dem LLM
Ein weiterer wichtiger Aspekt bei der Verarbeitung von Texten ist das sogenannte Text Chunking. Text Chunking bezeichnet die Methode, lange Texte in kleinere, leichter verarbeitbare Abschnitte (Chunks) zu zerlegen. Diese Chunks sind oft wenige Sätze oder Absätze lang und ermöglichen es dem LLM, gezielter auf bestimmte Informationen zuzugreifen und relevantere Antworten zu geben. Das Chunking verbessert die Genauigkeit der Suche, da das Modell auf kleinere und spezifischere Textteile zugreifen kann, anstatt einen ganzen langen Text analysieren zu müssen. Dies führt zu einer besseren Performance und präziseren Suchergebnissen, was insbesondere für umfangreiche Datenbestände von Vorteil ist.