1 Artikel · 3 Min. Lesezeit
Intranet-Crawler
Indexierung und Suche in eurem Organisationsintranet mit Intrics MCP-basiertem Intranet-Crawler.
Überblick
Abschnitt betitelt „Überblick“Der Intranet-Crawler ermöglicht es deinen Assistenten, Informationen aus dem internen Intranet eurer Organisation zu durchsuchen und abzurufen. Basierend auf dem Model Context Protocol (MCP)-Standard bietet er eurem Team authentifizierten Zugriff auf Intranet-Inhalte direkt in Intric-Gesprächen.
Jeder Kunde erhält eine separate Deployment — einen dedizierten Container, persistentes Volumen, Vektordatenbank und Ingress-Pfad — wobei ihr nur das Container-Image teilt. Deployments können keine Datenbanken teilen. Das Onboarding wird von Intric-Ingenieuren durchgeführt; es gibt keinen Selbstbedienungs-Onboarding-Prozess.
Der Crawler indexiert Inhalte hinter login-geschützten Intranets mit Hilfe von Anmeldeinformationen, die du während der Einrichtung bereitstellst. Dies umfasst Mitarbeiterhandbücher, Policy-Dokumente, interne Wikis und andere Ressourcen, die eine Authentifizierung erfordern.
Werkzeuge und Ressourcen
Abschnitt betitelt „Werkzeuge und Ressourcen“Der Crawler exponiert drei MCP-Tools und eine Ressource:
intranet_get_usage_guide
Abschnitt betitelt „intranet_get_usage_guide“Gibt diese Gebrauchsanweisung zurück. Die eigenen Anweisungen des Crawlers sagen dem Assistenten, dieses Tool zuerst in jedem Gespräch aufzurufen. Rufe es vor jedem anderen Crawler-Tool auf.
search_intranet
Abschnitt betitelt „search_intranet“Durchsuche indizierte Intranet-Inhalte und rufe relevante Informationen als Antwort auf Benutzerabfragen ab. Jeder Benutzer, der das Tool erreichen kann, sieht jede indizierte Seite. Der Index enthält nur das, was der Crawl-Konto während des Crawlings erreichen konnte, daher ist eine sorgfältige Scoping des Crawl-Kontos entscheidend, um Over-Indexing zu verhindern. Es gibt keine Berechtigungsprüfung zur Abfragezeit.
correct_intranet_answer
Abschnitt betitelt „correct_intranet_answer“Korrigiere eine Antwort — nicht den Index. Verwende dies, um eine bessere Antwort für ein bestimmtes Suchergebnis vorzuschlagen. Der Vorschlag wird an Administratoren weitergeleitet, die Änderungen prüfen, bearbeiten und genehmigen können. Akzeptierte Korrekturen werden sofort indiziert und haben Vorrang vor gecrawlten Inhalten in zukünftigen Antworten.
crawler_stats-Ressource
Abschnitt betitelt „crawler_stats-Ressource“Gibt Informationen über den aktuellen Crawl-Zustand zurück, einschließlich indizierter Seiten, letzter Crawling-Zeit und Crawl-Fehlern.
Wie es funktioniert
Abschnitt betitelt „Wie es funktioniert“Der Crawler operiert als benutzerdefinierter MCP-Server, den du über das eigene Admin-Panel des Crawlers unter https://mcp-servers.intric.ai/<kunde>-intranet/admin konfigurierst. Das Panel ist schwedisch-first mit einem Englisch-Toggle, und ist durch HTTP Basic-Authentifizierung geschützt. Sobald konfiguriert:
- Der Crawler besucht periodisch konfigurierte URLs auf deinem Intranet
- Er authentifiziert mit Hilfe der von dir bereitgestellten Anmeldeinformationen
- Inhalte werden extrahiert, verarbeitet und indiziert
- Assistenten mit dem Intranet-Crawler-Tool können diesen Inhalt durchsuchen
- Benutzer können Korrekturen über ein dediziertes Interface vorschlagen
- Administratoren prüfen Korrekturen im Admin-Panel des Crawlers
Intranet-Crawler-Modi
Abschnitt betitelt „Intranet-Crawler-Modi“Standard-Crawling
Abschnitt betitelt „Standard-Crawling“Der Crawler besucht dein Intranet direkt auf einer geplanten Basis. Geplante Crawls werden täglich um 02:00 Uhr UTC ausgeführt, mit einem zusätzlichen inkrementellen News-Crawl, der alle 30 Minuten läuft. Das Ändern eines Intervalls erfordert einen Pod-Neustart. Dieser Modus erfordert Netzwerkzugriff auf dein Intranet und während der Einrichtung konfigurierte Anmeldeinformationen.
Pre-crawled Data Mode
Abschnitt betitelt „Pre-crawled Data Mode“Ein alternativer Setup, bei dem der Crawler niemals dein Netzwerk berührt. Stattdessen crawlst du dein eigenes Intranet mit deinen eigenen Tools und übergibst eine Datendatei an Intric, die sie indexiert. Dieser Modus:
- Erfordert keinen Netzwerkzugriff auf dein Intranet von Intrics Seite
- Erfordert keine Crawl-Anmeldeinformationen
- Verwendet manuelle (nicht geplante) Updates — sende eine neue Datendatei, wenn sich Inhalte ändern
Dieser Modus ist für sicherheitskritische Kunden positioniert, die Intric keinen Zugang zu ihrem Intranet gewähren können. Warnung: ein Pre-crawled-Mode-Reindex zerstört akzeptierte Korrekturen, da er die Vektorsammlung löscht und durch eine frisch erstellte ersetzt.
Sicherheit und Berechtigungen
Abschnitt betitelt „Sicherheit und Berechtigungen“Der Crawler operiert unter den Berechtigungen des Kontos, das während der Einrichtung konfiguriert wurde. Das bedeutet:
- Der Index enthält nur Inhalte, die das Crawl-Konto erreichen konnte
- Jeder indizierte Inhalt wird für jeden Benutzer eines Assistenten mit dem Tool durchsuchbar — es gibt keine per-Benutzer-Filterung zur Abfragezeit
- Eine sorgfältige Scoping des Crawl-Kontos ist entscheidend, um Over-Indexing zu verhindern
Wichtig: Überprüfe das Berechtigungsmodell deines Intranets, bevor du den Crawler konfigurierst. Wenn dein Crawl-Konto breite Zugriffsrechte hat, überlege, ob alle indizierten Inhalte für alle Benutzer des Assistenten durchsuchbar sein sollten.
Sicherheitsklassifizierungsregeln gelten für das Intranet-Crawler-Tool genauso wie für andere Tools in Intric. Ein Assistent kann den Crawler nur verwenden, wenn er die Sicherheitsanforderungen des Spaces erfüllt, dem er angehört.
Dokument-Zitate
Abschnitt betitelt „Dokument-Zitate“Wenn ein Suchergebnis auf ein PDF oder anderes Dokument verweist, führt ein Klick auf das Zitat den Benutzer zur Elternseite, die das Dokument verlinkt hat — nicht zum Dokument selbst. Dies ist bewusst so designed.
Erweiterte Optionen
Abschnitt betitelt „Erweiterte Optionen“Zusätzliche Konfigurationsoptionen sind für bestimmte Anwendungsfälle verfügbar. Kontaktiere uns für Details zu:
- Extra Crawl-Quellen — indexiere eine zweite authentifizierte Website in derselben Wissensbasis, mit eigenen Anmeldeinformationen
- Zusätzliche Seed-URLs — Seiten, die kein Link auf deinem Intranet erreicht
- External-Link-Crawling — ein Schritt außerhalb des Intranets (standardmäßig aus, begrenzt auf 500 Seiten)
- Blocked-URL-Quarantäne und Junk-Page-Purging
- Erzwungene JavaScript-Rendering
- SharePoint-search-based discovery
Nächste Schritte
Abschnitt betitelt „Nächste Schritte“Bereit, Intranet-Suche für deine Organisation zu aktivieren?
- Kontaktiere uns unter support@intric.ai, um das Setup zu starten und mit unserem technischen Team zu koordinieren
- Lies den Artikel unten, um den Setup-Prozess zu verstehen und die notwendigen Informationen vorzubereiten.