Intranet-crawler · 3 min lukuaika
Asennus- ja määritysopas
Vaiheittainen ohje intranet-crawlerin käyttöönottoon organisaatiosi käyttöön.
Tämä opas käy läpi koko Intranet-crawlerin asennusprosessin alkaen alustavasta asetuksesta aina työkalun aktivoimiseen assistenteillesi. Asennus vaatii yhteistyötä Intricin teknisen tiimin kanssa — itsepalvelu-onboarding-virtaa ei ole.
Toiminnallisuuksien ja turvallisuuden korkean tason yleiskatsaukseksi lue alla oleva artikkeli.
Ennen asennusta
Osio nimeltä “Ennen asennusta”Varmista ennen asennusta seuraavat asiat:
- Olet tunnistanut, mitkä intranet-sisällöt halutaan indeksoitavan
- Olet luonut tai tunnistanut palvelutilin (tai sisäänkirjautumistilin), jolla on asianmukaiset oikeudet intranetissäsi
- Intranettisi on saatavilla HTTPS-yhteyden kautta
- Ymmärrät intranetisi varmennusvaatimukset
Vaihe 1: Pääse crawlerin adminpaneeliin
Osio nimeltä “Vaihe 1: Pääse crawlerin adminpaneeliin”Siirry osoitteeseen https://mcp-servers.intric.ai/<asiakas>-intranet/admin selaimessasi. Paneeli on suojattu HTTP Basic -varmennuksella — käytä onboardingin aikana antamiasi tunnuksia. Paneeli on ruotsinkielinen, ja siinä on englannin kielen vaihtoehto.
Huom: MCP-endpoint osoitteessa
https://mcp-servers.intric.ai/<asiakas>-intranet/mcpon erillinen IP-pohjainen pääsylukko. Jos et voi saavuttaa paneelia, varmista Intriciltä, että tulevat IP-osoitteet ovat sallittujen listalla.
Vaihe 2: Varmista palvelimen määritys
Osio nimeltä “Vaihe 2: Varmista palvelimen määritys”Crawler on jo määritetty sen palvelimen URL-osoitteella onboardingin aikana. URL noudattaa muotoa https://mcp-servers.intric.ai/<asiakas>-intranet/mcp, jossa <asiakas> on asiakastunnuksesi (esim. /varberg-intranet, /lidkoping, /oslo).
Jos suoritat crawleria omassa clusterissasi, URL noudattaa omaa infrastruktuurimalliasi.
API-avaimesi — 365 päivää voimassa oleva allekirjoitettu token, joka Intric-insinööri on luonut asiakkaan deploymentin salaisuudesta — on jo määritetty. Et voi uudelleengeneroida sitä itse — ota yhteyttä Intric-tukeen, kun se on uusittava.
Vaihe 3: Määritä crawlerin kohteet
Osio nimeltä “Vaihe 3: Määritä crawlerin kohteet”Crawlerin adminpaneelissa siirry Kohteet-osioon.
Määrität kaksi asetusta:
URL-ennakkoteksti
Osio nimeltä “URL-ennakkoteksti”Aseta url_filter_prefix yksittäiseksi ennakko tekstiksi. Tämä on polku, jota crawler seuraa. Syötä intranettisi juuri-URL tai tietty osa-alue.
Esimerkki:
url_filter_prefix: https://intranet.yrityksesi.fi/kayttoohjeURL-estot
Osio nimeltä “URL-estot”Aseta exclude_url_patterns aliverkkomallien listaksi. Mikä tahansa URL-osoite, joka sisältää yhden näistä aliverkoista, jätetään pois. Ei glob-syntaksia — nämä ovat yksinkertaisia aliverkko-osumia.
Esimerkki:
exclude_url_patterns: - /arkisto/ - /luonnokset/Nämä asetukset kirjoitetaan tiedostoon /data/crawler_config.json deploymentissa.
Vaihe 4: Määritä crawlerin varmennus
Osio nimeltä “Vaihe 4: Määritä crawlerin varmennus”Crawler tukee lomakepohjaista sisäänkirjautumista intranettiisi. Se käsittelee:
- Yleiset CMS-kirjautumislomakkeet
- Sitevision-portaalit
- Monivaiheiset Azure AD / Entra SAML -virrat, mukaan lukien “Pysy kirjautuneena?” -välilehdet
Syötä tunnukset, joita crawlerin tulee käyttää. Jotkin deploymentit crawleroivat julkisia sivustoja ilman minkäänlaista sisäänkirjautumista.
Tuetut tiedostotyypit: Crawler tunnistaa ja indeksoi .docx, .xlsx, .pdf ja .txt-tiedostot. Huomaa, että .doc- ja .xls-tiedostot tunnistetaan, mutta hiljaa ohitetaan. Dokumentin uuttamisella on seuraavat rajat:
- 10 MB hardkooodattu latausraja dokumenteille
- 20 MB määritettävä kokoraja (per-deployment-ympäristömuuttuja)
- PDF-tiedostoja luetaan vain sivulle 20 asti
- Uutettu teksti katkeaa 300 000 merkkiin
Ei tuettu: Crawler ei käsittele CAPTCHAa tai laitepohjaista kaksivaiheista varmennusta.
Vaihe 5: Dokumentin uuttamisen asetukset
Osio nimeltä “Vaihe 5: Dokumentin uuttamisen asetukset”Crawlerin adminpaneelissa on vain yksi dokumentin uuttamisen ohjaus: päälle/pois-ruksi. Tiedostotyypit ovat hardkoodeja (ks. yllä). Kokorajat asetetaan per-deployment ympäristömuuttujien kautta, ei käyttöliittymän kautta.
Vaihe 6: Aseta crawlerin aikataulu
Osio nimeltä “Vaihe 6: Aseta crawlerin aikataulu”Oletuksena täysi crawler ajetaan kerran päivässä klo 02:00 UTC.
Toinen ajoitettu tehtävä suorittaa inkrementaalisen uutiscrawlin joka 30. minuutti. Välitilan muuttaminen vaatii podin uudelleenkäynnistyksen.
Esikäsitetyn datatilan tapauksessa päivitykset ovat manuaalisia — lähetä uusi tiedosto, kun sisältö muuttuu. Ajoitetut crawlerit ohitetaan kokonaan tässä tilassa.
Vaihe 7: Testaa crawler
Osio nimeltä “Vaihe 7: Testaa crawler”Crawlerin adminpaneelissa on neljä painiketta testausta varten:
- Täyscrawle — crawleroi kaikki määritetyt kohteet
- Testicrawle (yksi sivu) — crawleroi yhden sivun varmistaaksesi määrityksen
- Uutiscrawle — käynnistä inkrementaalinen uutiscrawle
- Lisälähteet-crawle — crawleroi lisämääritetyt lähteet
Nämä ovat ainoat toiminnallisuudet paneelissa. “Validate connection” -painiketta ei ole.
Vaihe 8: Ota työkalu käyttöön assistenteillesi
Osio nimeltä “Vaihe 8: Ota työkalu käyttöön assistenteillesi”Kun määritys on valmis ja testattu:
- Siirry Työkalut-osioon Intric Space:ssä
- Etsi Intranet-crawler käytettävissä olevien työkalujen listasta
- Ota se käyttöön assistenteille tässä Space:ssä
- Määritä turvallisuusluokituksen asetukset tarvittaessa
Työkalu on nyt käytettävissä.
Korjausten hallinta
Osio nimeltä “Korjausten hallinta”Crawlerin adminpaneelissa siirry korjausten osioon, jossa näkyy odottavien korjausten merkki.
Vaihtoehdot jokaiselle odottavalle korjaukselle:
- Hyväksy — Indeksoi korjaus välittömästi. Hyväksytyt korjaukset saavat etusijan käsiteltyä sisältöä vastaan tulevissa vastauksissa.
- Muokkaa — Muokkaa korjausta ja hyväksy se yhdellä toiminnolla.
- Hylkää — Kieltäydy korjauksesta.
Vianmääritys
Osio nimeltä “Vianmääritys”| Ongelma | Ratkaisu |
|---|---|
| Paneeliin ei pääse | Varmista, että tulevat IP-osoitteet ovat sallittujen listalla — ota yhteyttä Intric-tukeen |
| Crawler ei palauta sivuja | Tarkista crawlerin kohteet ja URL-estot; varmista crawler-tilin oikeudet |
| Crawler on hidas | Vähennä crawlerin syvyyttä (oletus 3) tai rajoita URL-estoja; tarkista nopeusrajoitus |
| Varmennus epäonnistuu | Tarkista lomakkeen kirjautumisen määritys; crawler ei tue Basic authia kohteisiin |
| Korjaukset eivät näy | Varmista, että correct_intranet_answer-toiminto on aktivoitu assistentissa |
Crawler-lokit kirjoitetaan podin tuotantoon ja ne luetaan kubectl:n avulla — tämä on Intric-insinöörin toiminto, ei asiakasrajapinta. Käyttöliittymässä ei ole lokinäyttöä.
Jos kohtaat ongelmia asennuksen aikana tai tarvitset apua, ota yhteyttä Intric-tukeen:
- Asiakastunnuksesi (adminpaneelin URL-osoitteen polkuosa)
- Ongelman kuvaus
- Mahdolliset virheilmoitukset, joita näet