Web scraper

Automaattinen työkalu tietojen keräämiseen verkkosivuilta. Opi HTML-parsintaa, datan käsittelyä ja API-rajapintoja - hyödyllinen taito monessa projektissa.

Keskitaso · 3-5 tuntia · Node.js, TypeScript, Cheerio, Puppeteer

Aloitusprompt

Kopioi tämä Cursoriin tai Claude Codeen ja aloita rakentaminen.

Luo web scraper Node.js:llä.

Ominaisuudet:
- Hae HTML Cheerio:lla
- Parsii määritellyt elementit
- Tallenna tulokset JSON-tiedostoon
- Rate limiting (odota pyyntöjen välillä)
- Virheiden käsittely ja retry-logiikka

Esimerkki: Scrape Hacker News -etusivu
- Kerää: otsikko, linkki, pisteet, kommenttien määrä
- Tallenna data.json tiedostoon

Käytä TypeScriptiä ja tee modulaarinen rakenne.

Vaiheet

1. Perus-scraper

Luo yksinkertainen HTML-parseri.

Luo Node.js-scraper joka hakee verkkosivun ja parsii siitä tietoja Cheeriolla. Esimerkki: hae uutissivuston otsikot ja linkit.

2. Dynaaminen sisältö

Lisää tuki JavaScript-sivuille.

Lisää Puppeteer dynaamisen sisällön scrapingiin. Odota sivun latautumista, scrollaa ja kerää data. Esimerkki: scrape tuotteita verkkokaupasta.

3. Datan tallennus

Tallenna kerätty data tiedostoon.

Lisää funktiot datan tallentamiseen CSV- ja JSON-muotoihin. Luo myös Supabase-tallennus reaaliaikaiseen seurantaan.

Ominaisuudet

HTML-parsinta

Dynaamisten sivujen tuki

Datan tallennus CSV/JSON

Rate limiting

Virheiden käsittely

Laajennusideat

Kun perusprojekti on valmis:

Ajastettu scraping (cron)

Notification uusista tuloksista

Web UI tulosten tarkasteluun

Proxy-tuki

Captcha-kierto (eettisesti)