Intranätscrawler · 3 min läsning
Guide för installation och konfiguration
Steg-för-steg-guide för att sätta upp intranätscrawlern i er organisation.
Denna guide går igenom hela setup-processen för Intranet crawlern, från initial konfiguration till att aktivera verktyget för dina assistenter. Setup kräver samarbete med vårt tekniska team på Intric — det finns ingen självständig onboarding-flöde.
För en hög nivå översikt av funktioner och säkerhet, se artikeln nedan.
Förutsättningar
Section titled “Förutsättningar”Innan du börjar setup, se till att följande:
- Du har identifierat vilket intranätsinnehåll som ska indexeras
- Du har skapat eller identifierat ett tjänstekonto (eller inloggningskonto) med lämpliga behörigheter på ditt intranät
- Ditt intranät är tillgängligt över HTTPS
- Du förstår ditt intranäts autentiseringskrav
Steg 1: Nå crawler-adminpanelen
Section titled “Steg 1: Nå crawler-adminpanelen”Navigera till https://mcp-servers.intric.ai/<kund>-intranet/admin i din webbläsare. Panelen är skyddad av HTTP Basic-authentisering — använd autentiseringsuppgifterna som tillhandahölls under din onboarding. Panelen är svenska-först med en engelsk-toggel.
Obs: MCP-endpointen på
https://mcp-servers.intric.ai/<kund>-intranet/mcphar en separat IP-baserad åtkomstgräns. Om du inte kan nå panelen, verifiera med Intric att dina inkommande IP-adresser är på allowlistan.
Steg 2: Verifiera serverkonfiguration
Section titled “Steg 2: Verifiera serverkonfiguration”Crawlern är redan konfigurerad med sin server-URL under onboarding. URL:en följer mönstret https://mcp-servers.intric.ai/<kund>-intranet/mcp där <kund> är din kundidentifierare (t.ex. /varberg-intranet, /lidkoping, /oslo).
Om du kör crawlern i ditt eget kluster kommer URL:en att följa ditt egen infrastruktur mönster.
Ditt API-nyckel — en 365-dagar signerad token myntad av en Intric-ingenjör från kundens deployment-secret — är redan konfigurerad. Du kan inte förnya det själv — kontakta Intric-support när det behöver förnyas.
Steg 3: Konfigurera crawl-mål
Section titled “Steg 3: Konfigurera crawl-mål”I crawler-adminpanelen, navigera till Mål-sektionen.
Du konfigurerar två inställningar:
URL-prefix
Section titled “URL-prefix”Ställ in url_filter_prefix till ett enkelt prefix-sträng. Detta är bas-sökvägen crawlern ska följa. Ange rot-URL:en för ditt intranät eller en specifik sektion.
Exempel:
url_filter_prefix: https://intranet.dittforetag.se/handbokURL-exklusioner
Section titled “URL-exklusioner”Ställ in exclude_url_patterns till en lista med substring-mönster. Alla URL:er som innehåller en av dessa substrings kommer att exkluderas. Ingen glob-syntax — dessa är enkla substring-matchningar.
Exempel:
exclude_url_patterns: - /archive/ - /utkast/Dessa inställningar skrivs till /data/crawler_config.json på deploymenten.
Steg 4: Konfigurera autentisering för crawlern
Section titled “Steg 4: Konfigurera autentisering för crawlern”Crawlern stödjer formulärbaserad inloggning till ditt intranät. Den hanterar:
- Generiska CMS-inloggningsformulär
- Sitevision-portaler
- Multi-stegs Azure AD / Entra SAML-flöden, inklusive “Stanna inloggad?”-interstitier
Ange autentiseringsuppgifterna för kontot crawlern ska använda. Vissa deploymentar crawlar offentliga webbplatser utan någon inloggning alls.
Stödda filtyper: Crawlern detekterar och indexerar .docx, .xlsx, .pdf och .txt-filer. Notera att .doc och .xls-filer detekteras men tyst släpps. Dokumentextraktion har följande gränser:
- 10 MB hårdkodad nedladdningsgräns för dokument
- 20 MB konfigurerbar storleksgräns (per-deployment miljövariabel)
- PDF:er läses endast till sida 20
- Extraherad text trunceras vid 300 000 tecken
Ej stödda: Crawlern hanterar inte CAPTCHA eller enhetsbaserad tvåfaktorsautentisering.
Steg 5: Dokumentextraktionsinställningar
Section titled “Steg 5: Dokumentextraktionsinställningar”I crawler-adminpanelen finns en enda dokumentextraktionskontroll: en av/på-checkbox. Filtyper är hårdkodade (se ovan). Storleksgränser ställs in per-deployment via miljövariabler, inte via UI:en.
Steg 6: Konfigurera crawl-schema
Section titled “Steg 6: Konfigurera crawl-schema”Standard full-crawl körs en gång dagligen kl. 02:00 UTC.
En andra schemalagd jobb utför inkrementell nyhetskrawl var 30:e minut. För att ändra något intervall måste du starta om podden.
För för-crawlat dataläge är uppdateringarna manuella — skicka en ny datafil när innehållet ändras. Schemalagda crawls hoppas över helt i det läget.
Steg 7: Testa crawl
Section titled “Steg 7: Testa crawl”Crawler-adminpanelen erbjuder fyra knappar för testning:
- Full-crawl — crawla alla konfigurerade mål
- Test-crawl (en sida) — crawla en enda sida för att verifiera konfiguration
- Nyhetskrawl — trigga den inkrementella nyhetskrawl
- Extra-källor-crawl — crawla ytterligare konfigurerade källor
Detta är de enda operationskontrollerna i panelen. Det finns ingen “Validate connection”-knapp.
Steg 8: Aktivera verktyget för dina assistenter
Section titled “Steg 8: Aktivera verktyget för dina assistenter”När konfiguration är komplett och testad:
- Navigera till Verktyg-sektionen i ditt Intric Space
- Hitta Intranet crawlern i listan över tillgängliga verktyg
- Aktivera det för assistenter i det Space
- Konfigurera säkerhetsklassificeringsinställningar om det krävs
Verktyget är nu tillgängligt för användning.
Hantera korrigeringar
Section titled “Hantera korrigeringar”I crawler-adminpanelen, navigera till korrigeringsssektionen, som visar en pending-count-badge.
Alternativ för varje väntande korrigering:
- Acceptera — Indexera korrigeringen omedelbart. Godkända korrigeringar har företräde framför crawlat innehåll i framtida svar.
- Redigera — Redigera korrigeringen och acceptera den i en åtgärd.
- Avvisa — Avböj korrigeringen.
Felsökning
Section titled “Felsökning”| Problem | Lösning |
|---|---|
| Kan inte nå adminpanelen | Verifiera att dina inkommande IP-adresser är på allowlistan — kontakta Intric-support |
| Crawl returnerar inga sidor | Kontrollera crawl-mål och URL-exklusioner; verifiera crawl-kontobehörigheter |
| Crawling är långsam | Minska crawl-djup (standard 3) eller begränsa URL-exklusioner; kontrollera hastighetsbegränsning |
| Autentisering misslyckas | Granska formulär-inloggningskonfigurationen; crawlern stödjer inte Basic auth till målsajter |
| Korrigeringar syns inte | Se till att correct_intranet_answer-kapacitet är aktiverad på assistenten |
Crawl-logs skrivs till pod-output och läses via kubectl — detta är en Intric-ingenjöråtgärd, inte en kundvänlig funktion. Det finns ingen loggviss i UI:en.
Få hjälp
Section titled “Få hjälp”Om du stöter på problem under setup eller behöver hjälp, kontakta Intric-support:
- Din kundidentifierare (sökväg-segmentet i din adminpanel-URL)
- Beskrivning av problemet
- Eventuella felmeddelanden du ser