Hosting per web scraping
Risposta
L'infrastruttura di scraping necessita di indirizzi non già bloccati e della potenza per eseguire browser headless. Incognito VPS assegna pool di IPv4 puliti verificati su oltre 60 blocklist, vende indirizzi aggiuntivi a $2.50 al mese da /24 separati e non richiede verifica dell'identità.
| Scenario | Minimo |
|---|---|
| Scraping HTTP | 2 vCPU, 4 GB di RAM |
| Browser headless (5–10) | 6 vCPU, 16 GB di RAM |
| Crawling esteso + parsing | 16 vCPU, 64 GB di RAM |
| Diversità degli indirizzi | $2.50/mese per IPv4 aggiuntivo |
La reputazione dell'indirizzo decide il successo
La maggior parte dei sistemi anti-bot controlla l'indirizzo prima di qualsiasi altra cosa. Gli intervalli appartenenti a noti cloud sono pre-classificati come traffico datacenter e trattati con sospetto di default; gli intervalli con una storia di abusi sono semplicemente bloccati.
Il nostro pool IPv4 è controllato contro oltre sessanta blocklist al momento dell'assegnazione e ogni sei ore dopo; la policy di utilizzo accettabile che rimuove i clienti abusivi è ciò che lo mantiene tale. Gli indirizzi aggiuntivi provengono da /24 separati, così un singolo blocco non elimina l'intero pool.
Dimensionamento per browser headless
Lo scraping HTTP semplice è economico: una piccola VPS saturerà la rete molto prima della CPU. Chrome headless è l'opposto: ogni istanza richiede circa 300-500 MB di RAM e una parte significativa di un core, quindi la concorrenza è limitata dalla memoria.
Dieci istanze Chrome concorrenti sono comode su 16 GB. Se usi Playwright o Puppeteer su larga scala, pianifica prima la memoria e poi i core.
Fai le cose per bene
Rispetta robots.txt, limitati a te stesso, identifica il tuo crawler nel user agent con un indirizzo di contatto e fai cache aggressiva per non ri-scaricare ciò che hai già. Non è moralismo: è il modo per evitare di essere bloccato, e gli operatori che vengono bloccati sono quelli che martellano.
La nostra policy di utilizzo accettabile vieta il credential stuffing, lo scraping dietro autenticazione che non sei autorizzato a detenere e la raccolta di dati personali in violazione della legge applicabile. La raccolta di dati dal web pubblico è consentita e lo è sempre stata.
Domande frequenti
01 I vostri IP sono bloccati dai servizi anti-bot?
I nostri intervalli non sono nelle blocklist di abuso, che è la cosa principale che controlli. Qualsiasi intervallo datacenter può comunque essere classificato come traffico datacenter da un sistema anti-bot sofisticato: è insito nell'hosting, non specifico di noi.
02 Posso avere più indirizzi IP?
Sì, $2.50/mese ciascuno, fino a sedici per server, allocati da /24 separati così un blocco non elimina l'intero pool. Nessun modulo di giustificazione.
03 Quale piano per i browser headless?
BASTION (6 vCPU, 16 GB) esegue circa dieci istanze Chrome concorrenti. Ogni istanza richiede 300–500 MB, quindi il vincolo è la memoria, non i core.
04 Lo scraping è consentito dalla vostra AUP?
La raccolta di dati dal web pubblico è consentita. Credential stuffing, accesso a dati dietro autenticazione non autorizzata e raccolta di dati personali in violazione della legge applicabile non lo sono.
Correlati