Intranett-crawler · 3 min lesing
Installasjons- og konfigurasjonsguide
Trinnvis guide for å sette opp intranett-crawleren for organisasjonen din.
Denne guiden går gjennom hele setup-prosessen for Intranett-crawleren, fra initial konfigurasjon til å aktivere verktøyet for dine assistenter. Setup krever samarbeid med vårt tekniske team på Intric — det finnes ingen selvbetjent onboarding-prosess.
For en høynivå oversikt over funksjoner og sikkerhet, se artikkelen nedenfor.
Forutsetninger
Section titled “Forutsetninger”Før du starter setup, sørg for følgende:
- Du har identifisert hvilket intranettinnhold som skal indekseres
- Du har opprettet eller identifisert en brukerkonto (eller innloggingskonto) med passende rettigheter på ditt intranett
- Ditt intranett er tilgjengelig over HTTPS
- Du forstår ditt intranetts autentiseringskrav
Steg 1: Nå crawler-adminpanelet
Section titled “Steg 1: Nå crawler-adminpanelet”Naviger til https://mcp-servers.intric.ai/<kunde>-intranett/admin i nettleseren din. Panelet er beskyttet av HTTP Basic-autentisering — bruk autentiseringsopplysningene som ble oppgitt under din onboarding. Panelet er norsk-først med en engelsk-toggel.
Merk: MCP-endepunktet på
https://mcp-servers.intric.ai/<kunde>-intranett/mcphar en separat IP-basert tilgangsport. Hvis du ikke kan nå panelet, bekreft med Intric at dine innkommende IP-adresser er på allowlisten.
Steg 2: Bekreft serverkonfigurasjon
Section titled “Steg 2: Bekreft serverkonfigurasjon”Crawleren er allerede konfigurert med sin server-URL under onboarding. URL-en følger mønsteret https://mcp-servers.intric.ai/<kunde>-intranett/mcp der <kunde> er din kundeidentifikator (f.eks. /varberg-intranett, /lidkoping, /oslo).
Hvis du kjører crawleren i ditt eget cluster vil URL-en følge din egen infrastruktur mønster.
Din API-nøkkel — et 365-dagers signert token preget av en Intric-ingeniør fra kundens deployment secret — er allerede konfigurert. Du kan ikke fornye det selv — kontakt Intric-støtte når det trenger fornyelse.
Steg 3: Konfigurer crawl-mål
Section titled “Steg 3: Konfigurer crawl-mål”I crawler-adminpanelet, naviger til Mål-seksjonen.
Du konfigurerer to innstillinger:
URL-prefix
Section titled “URL-prefix”Sett url_filter_prefix til et enkelt prefix-streng. Dette er basissøkvægen crawleren skal følge. Angi rot-URL-en til ditt intranett eller en spesifikk seksjon.
Eksempel:
url_filter_prefix: https://intranet.dinbedrift.no/håndbokURL-ekskluderinger
Section titled “URL-ekskluderinger”Sett exclude_url_patterns til en liste med substring-mønstre. Alle URL-er som inneholder en av disse substringene vil bli ekskludert. Ingen glob-syntaks — disse er enkle substring-matchninger.
Eksempel:
exclude_url_patterns: - /arkiv/ - /utkast/Disse innstillingene skrives til /data/crawler_config.json på deploymenten.
Steg 4: Konfigurer autentisering for crawleren
Section titled “Steg 4: Konfigurer autentisering for crawleren”Crawleren støtter formularenbasert innlogging til ditt intranett. Den håndterer:
- Generiske CMS-innloggings skjemaer
- Sitevision-portaler
- Multi-stegs Azure AD / Entra SAML-flyter, inkludert “Bli logget inn?”-interstitier
Angi autentiseringsopplysningene for kontoen crawleren skal bruke. Noen deployements crawler offentlige nettsteder uten noen innlogging i det hele tatt.
Støttede filtyper: Crawleren detekterer og indekserer .docx, .xlsx, .pdf og .txt-filer. Merk at .doc og .xls-filer detekteres men stille slippes. Dokumentekstraksjon har følgende grenser:
- 10 MB hardkodet nedlastingsgrense for dokumenter
- 20 MB konfigurerbar størrelsesgrense (per-deployment miljøvariabel)
- PDF-er leses bare til side 20
- Ekstrahert tekst trunceres ved 300 000 tegn
Ikke støttet: Crawleren håndterer ikke CAPTCHA eller enhetsbasert to-faktor-autentisering.
Steg 5: Dokumentekstraksjonsinnstillinger
Section titled “Steg 5: Dokumentekstraksjonsinnstillinger”I crawler-adminpanelet finnes det en enkelt dokumentekstraksjonskontroll: en av/på-boks. Filtyper er hardkodet (se ovenfor). Størrelsesgrenser stilles inn per-deployment via miljøvariabler, ikke gjennom UI:en.
Steg 6: Konfigurer crawl-plan
Section titled “Steg 6: Konfigurer crawl-plan”Standard full-crawl kjøres en gang daglig kl. 02:00 UTC.
En andre planlagt jobb utfører inkrementell nyhets-crawl hvert 30. minutt. For å endre noe intervall må du restarte poden.
For for-crawlet data-modus er oppdateringene manuelle — send en ny datafil når innholdet endres. Planlagte crawls hoppes over helt i den modusen.
Steg 7: Test crawl
Section titled “Steg 7: Test crawl”Crawler-adminpanelet tilbyr fire knapper for testing:
- Full-crawl — crawl alle konfigurerte mål
- Test-crawl (én side) — crawl én enkelt side for å bekrefte konfigurasjon
- Nyhets-crawl — trigge den inkrementelle nyhets-crawl
- Ekstra-kilder-crawl — crawl ytterligere konfigurerte kilder
Dette er de eneste operasjonskontrollene i panelet. Det finnes ingen “Bekreft tilkobling”-knapp.
Steg 8: Aktiver verktøyet for dine assistenter
Section titled “Steg 8: Aktiver verktøyet for dine assistenter”Når konfigurasjon er fullført og testet:
- Naviger til Verktøy-seksjonen i din Intric Space
- Finn Intranett-crawleren i listen over tilgjengelige verktøy
- Aktiver den for assistenter i den Space
- Konfigurer sikkerhetsklassifiseringsinnstillinger hvis nødvendig
Verktøyet er nå tilgjengelig for bruk.
Håndtere korrigeringer
Section titled “Håndtere korrigeringer”I crawler-adminpanelet, naviger til korreksjoner-seksjonen, som viser en pending-count-badge.
Alternativer for hver ventende korreksjon:
- Godkjenn — Indekses korreksjonen umiddelbart. Godkjente korreksjoner har forrang fremfor crawlet innhold i fremtidige svar.
- Rediger — Rediger korreksjonen og godkjenn den i én handling.
- Avvis — Avslå korreksjonen.
Feilsøking
Section titled “Feilsøking”| Problem | Løsning |
|---|---|
| Kan ikke nå adminpanelet | Bekreft at dine innkommende IP-adresser er på allowlisten — kontakt Intric-støtte |
| Crawl returnerer ingen sider | Sjekk crawl-mål og URL-ekskluderinger; bekreft crawl-kontorettigheter |
| Crawl er treg | Reduser crawl-dyp (standard 3) eller begrense URL-ekskluderinger; sjekk hastighetsbegrensning |
| Autentisering feiler | Gransk formulinæring-konfigurasjonen; crawleren støtter ikke Basic auth til mål-sider |
| Korreksjoner vises ikke | Sørg for at correct_intranet_answer-kapasitet er aktivert på assistenten |
Crawl-logger skrives til pod-output og leses via kubectl — dette er en Intric-ingeniør handling, ikke en kunde-vennlig funksjon. Det finnes ingen loggvisning i UI:en.
Få hjelp
Section titled “Få hjelp”Hvis du møter problemer under setup eller trenger hjelp, kontakt Intric-støtte:
- Din kundeidentifikator (søkvægen-segmentet i din adminpanel-URL)
- Beskrivelse av problemet
- Eventuelle feilmeldinger du ser