Hoppa till innehåll
Service status

Skriv för att söka

Intranätscrawler · 3 min läsning

Guide för installation och konfiguration

Steg-för-steg-guide för att sätta upp intranätscrawlern i er organisation.

Denna guide går igenom hela setup-processen för Intranet crawlern, från initial konfiguration till att aktivera verktyget för dina assistenter. Setup kräver samarbete med vårt tekniska team på Intric — det finns ingen självständig onboarding-flöde.

För en hög nivå översikt av funktioner och säkerhet, se artikeln nedan.

Innan du börjar setup, se till att följande:

  • Du har identifierat vilket intranätsinnehåll som ska indexeras
  • Du har skapat eller identifierat ett tjänstekonto (eller inloggningskonto) med lämpliga behörigheter på ditt intranät
  • Ditt intranät är tillgängligt över HTTPS
  • Du förstår ditt intranäts autentiseringskrav

Navigera till https://mcp-servers.intric.ai/<kund>-intranet/admin i din webbläsare. Panelen är skyddad av HTTP Basic-authentisering — använd autentiseringsuppgifterna som tillhandahölls under din onboarding. Panelen är svenska-först med en engelsk-toggel.

Obs: MCP-endpointen på https://mcp-servers.intric.ai/<kund>-intranet/mcp har en separat IP-baserad åtkomstgräns. Om du inte kan nå panelen, verifiera med Intric att dina inkommande IP-adresser är på allowlistan.

Crawlern är redan konfigurerad med sin server-URL under onboarding. URL:en följer mönstret https://mcp-servers.intric.ai/<kund>-intranet/mcp där <kund> är din kundidentifierare (t.ex. /varberg-intranet, /lidkoping, /oslo).

Om du kör crawlern i ditt eget kluster kommer URL:en att följa ditt egen infrastruktur mönster.

Ditt API-nyckel — en 365-dagar signerad token myntad av en Intric-ingenjör från kundens deployment-secret — är redan konfigurerad. Du kan inte förnya det själv — kontakta Intric-support när det behöver förnyas.

I crawler-adminpanelen, navigera till Mål-sektionen.

Du konfigurerar två inställningar:

Ställ in url_filter_prefix till ett enkelt prefix-sträng. Detta är bas-sökvägen crawlern ska följa. Ange rot-URL:en för ditt intranät eller en specifik sektion.

Exempel:

url_filter_prefix: https://intranet.dittforetag.se/handbok

Ställ in exclude_url_patterns till en lista med substring-mönster. Alla URL:er som innehåller en av dessa substrings kommer att exkluderas. Ingen glob-syntax — dessa är enkla substring-matchningar.

Exempel:

exclude_url_patterns:
- /archive/
- /utkast/

Dessa inställningar skrivs till /data/crawler_config.json på deploymenten.

Steg 4: Konfigurera autentisering för crawlern

Section titled “Steg 4: Konfigurera autentisering för crawlern”

Crawlern stödjer formulärbaserad inloggning till ditt intranät. Den hanterar:

  • Generiska CMS-inloggningsformulär
  • Sitevision-portaler
  • Multi-stegs Azure AD / Entra SAML-flöden, inklusive “Stanna inloggad?”-interstitier

Ange autentiseringsuppgifterna för kontot crawlern ska använda. Vissa deploymentar crawlar offentliga webbplatser utan någon inloggning alls.

Stödda filtyper: Crawlern detekterar och indexerar .docx, .xlsx, .pdf och .txt-filer. Notera att .doc och .xls-filer detekteras men tyst släpps. Dokumentextraktion har följande gränser:

  • 10 MB hårdkodad nedladdningsgräns för dokument
  • 20 MB konfigurerbar storleksgräns (per-deployment miljövariabel)
  • PDF:er läses endast till sida 20
  • Extraherad text trunceras vid 300 000 tecken

Ej stödda: Crawlern hanterar inte CAPTCHA eller enhetsbaserad tvåfaktorsautentisering.

I crawler-adminpanelen finns en enda dokumentextraktionskontroll: en av/på-checkbox. Filtyper är hårdkodade (se ovan). Storleksgränser ställs in per-deployment via miljövariabler, inte via UI:en.

Standard full-crawl körs en gång dagligen kl. 02:00 UTC.

En andra schemalagd jobb utför inkrementell nyhetskrawl var 30:e minut. För att ändra något intervall måste du starta om podden.

För för-crawlat dataläge är uppdateringarna manuella — skicka en ny datafil när innehållet ändras. Schemalagda crawls hoppas över helt i det läget.

Crawler-adminpanelen erbjuder fyra knappar för testning:

  • Full-crawl — crawla alla konfigurerade mål
  • Test-crawl (en sida) — crawla en enda sida för att verifiera konfiguration
  • Nyhetskrawl — trigga den inkrementella nyhetskrawl
  • Extra-källor-crawl — crawla ytterligare konfigurerade källor

Detta är de enda operationskontrollerna i panelen. Det finns ingen “Validate connection”-knapp.

Steg 8: Aktivera verktyget för dina assistenter

Section titled “Steg 8: Aktivera verktyget för dina assistenter”

När konfiguration är komplett och testad:

  1. Navigera till Verktyg-sektionen i ditt Intric Space
  2. Hitta Intranet crawlern i listan över tillgängliga verktyg
  3. Aktivera det för assistenter i det Space
  4. Konfigurera säkerhetsklassificeringsinställningar om det krävs

Verktyget är nu tillgängligt för användning.

I crawler-adminpanelen, navigera till korrigeringsssektionen, som visar en pending-count-badge.

Alternativ för varje väntande korrigering:

  • Acceptera — Indexera korrigeringen omedelbart. Godkända korrigeringar har företräde framför crawlat innehåll i framtida svar.
  • Redigera — Redigera korrigeringen och acceptera den i en åtgärd.
  • Avvisa — Avböj korrigeringen.
Problem Lösning
Kan inte nå adminpanelen Verifiera att dina inkommande IP-adresser är på allowlistan — kontakta Intric-support
Crawl returnerar inga sidor Kontrollera crawl-mål och URL-exklusioner; verifiera crawl-kontobehörigheter
Crawling är långsam Minska crawl-djup (standard 3) eller begränsa URL-exklusioner; kontrollera hastighetsbegränsning
Autentisering misslyckas Granska formulär-inloggningskonfigurationen; crawlern stödjer inte Basic auth till målsajter
Korrigeringar syns inte Se till att correct_intranet_answer-kapacitet är aktiverad på assistenten

Crawl-logs skrivs till pod-output och läses via kubectl — detta är en Intric-ingenjöråtgärd, inte en kundvänlig funktion. Det finns ingen loggviss i UI:en.

Om du stöter på problem under setup eller behöver hjälp, kontakta Intric-support:

  • Din kundidentifierare (sökväg-segmentet i din adminpanel-URL)
  • Beskrivning av problemet
  • Eventuella felmeddelanden du ser