Cos'è Sfoglia AI?
Sfoglia AI è una piattaforma di monitoraggio e estrazione web senza codice ospitata. Un utente installa il registratore, dimostra la navigazione e seleziona campi o elenchi; Sfoglia AI converte quella sessione in un "robot" in grado di accettare input, seguire pagine, estrarre righe strutturate, acquisire screenshot e ripetere secondo una pianificazione. I robot precostruiti evitano la registrazione per fonti comuni selezionate.
Il risultato può rimanere nell'area di lavoro o spostarsi attraverso CSV, Fogli Google, Airtable, Amazon S3, API REST, webhook, Zapier, Make, Pabbly e flussi di lavoro più ampi. Sfoglia AI posiziona inoltre le pagine estratte come nuovo contesto per le pipeline LLM e RAG. Ciò lo rende più di uno scraper una tantum: può diventare una fonte di dati operativa, con corrispondenti obblighi di affidabilità, licenza, privacy e derivazione.
Robot, monitoraggio e affidabilità
Un robot può aprire una pagina, accedere, fare clic, inserire parametri, esporre contenuti nascosti, impaginare, visitare pagine di dettagli, acquisire campi e confrontare esecuzioni successive. Lo scraping approfondito è utile per trasformare un'inserzione in una riga per articolo più i dettagli, ma ogni pagina dei dettagli è un'attività e un centro di costo separato.
Nessun codice non significa esente da manutenzione. Un pulsante rinominato, un DOM modificato, un esperimento, un'impostazione locale, una finestra di dialogo dei cookie, una sessione scaduta, un proxy bloccato, uno scorrimento infinito o un JavaScript ritardato possono creare dati mancanti o spostati. CAPTCHA e proxy residenziali possono migliorare l'accesso a siti più difficili, ma non garantiscono completezza o autorizzazione. Trattare le modifiche al selettore e le esecuzioni “riuscite” vuote con sospetto come incidenti.
Per la produzione, definisci il numero di righe previsto e i campi obbligatori, convalida tipi e unicità, esegui campioni rispetto all'origine, memorizza l'URL di origine e il tempo di estrazione, avvisa in caso di deviazione, metti in quarantena modifiche di grandi dimensioni e mantieni un fallback manuale o con licenza. Testa la stessa origine per gli stati di disconnessione/accesso, desktop, regione, impaginazione ed errore.
Prezzi attuali e matematica del credito
La versione gratuita fornisce 50 crediti mensili, due domini, tre utenti, robot illimitati e accesso alle funzionalità. Il piano personale parte da $ 19 al mese con fatturazione annuale di $ 228 con 12.000 crediti in anticipo, cinque domini e tre utenti; la sua opzione mensile di 2.000 crediti è di $ 48. Professional parte da $ 69 al mese fatturati $ 828 all'anno con 60.000 crediti, dieci domini e dieci utenti; il mese inizia da $87 per 5.000 crediti. Il piano Premium parte da $ 500 al mese fatturati annualmente per oltre 600.000 crediti, limiti personalizzati e configurazione gestita.
I piani espongono anche varianti di credito più elevate. I componenti aggiuntivi e le ricariche del dominio variano in base al piano e alla durata della fatturazione. I crediti annuali possono essere spesi in qualsiasi momento dell'anno, ma i crediti non utilizzati vengono ripristinati alla fine del ciclo. La conservazione dei dati standard viene indicata come 90 giorni; Il premio è personalizzato.
Sui siti standard, ogni attività costa almeno un credito, dieci righe costano un credito e uno screenshot costa un credito. Le fonti premium impongono un minimo/moltiplicatore da due a dieci crediti. Un elenco di 100 elementi costa circa dieci crediti, ma visitare 100 pagine di dettaglio ne aggiunge almeno 100. Il monitoraggio di dieci pagine di dettaglio ogni tre giorni equivale a circa 100 crediti al mese prima di moltiplicatori premium, nuovi tentativi, screenshot o passaggi del flusso di lavoro. Stima con un vero pilota e aggiungi margine di fallimento/riqualificazione.
Credenziali, dati estratti e sicurezza
L'informativa sulla privacy afferma che i robot possono raccogliere URL di origine, nomi utente, cookie di sessione, parametri di archiviazione locale e password quando è richiesto l'accesso; le password sono crittografate. Sfoglia AI afferma che gli input crittografati sensibili non vengono registrati, il supporto non può vedere gli input crittografati e l'accesso di supporto ai robot richiede una richiesta esplicita ed è monitorato. Segnala il completamento del SOC 2 Tipo II e offre un Trust Center.
Il prezzo standard prevede una conservazione di 90 giorni, mentre l'informativa sulla privacy utilizza periodi basati sullo scopo e sull'obbligo legale per informazioni personali più ampie. Determina separatamente la durata della persistenza di risultati, screenshot, log di esecuzione, cookie, credenziali, backup, esportazioni, elementi di supporto e dati di account eliminati. Ruota le credenziali, utilizza un account di origine dedicato con privilegi minimi, evita accessi personali, limita i ruoli dell'area di lavoro e le chiavi API e revoca l'accesso quando un robot si ferma.
I termini di Sfoglia AI affermano che i clienti mantengono i diritti sui dati dei clienti ma concedono i diritti di elaborazione necessari per gestire e migliorare il servizio e creare dati aggregati. Le norme sulla privacy affermano specificamente che i dati API di Google Workspace non vengono conservati per sviluppare, migliorare o addestrare modelli AI/ML generalizzati; non trasformare questa affermazione ristretta in una promessa generale di assenza di formazione per ogni classe di dati. Esaminare il DPA operativo e fidarsi delle prove per le implementazioni sensibili.
Eliminazione della legge, dei diritti di fonte e dell'intelligenza artificiale a valle
La possibilità di caricare una pagina non costituisce una licenza per raccogliere, ripubblicare, profilare o vendere i suoi contenuti. Prima dell'automazione, registrare il proprietario della fonte, il metodo di accesso, i termini, la guida dei robot, i limiti di velocità, i diritti di copyright/database, la base dei dati personali, gli obblighi di notifica e cancellazione, le restrizioni contrattuali e lo scopo a valle consentito. I dati di accesso, i profili delle persone, le informazioni sanitarie/finanziarie, i minori, i media protetti da copyright e la ripubblicazione competitiva necessitano di una revisione approfondita.
Utilizza pianificazioni lente e prevedibili, memorizza nella cache le pagine non modificate, raccogli solo i campi necessari, rispetta l'eliminazione e la soppressione e fornisci l'attribuzione dove richiesto. Se l'output alimenta un LLM, il fornitore LLM diventa un'altra destinazione con i propri rischi di formazione, fidelizzazione, ubicazione e inserimento tempestivo. Mantieni la provenienza per riga e tratta le istruzioni raschiate come dati non attendibili anziché come comandi eseguibili.
Verdetto
Sfoglia AI è un ponte pratico tra la navigazione manuale e le pipeline di dati ingegnerizzati. Il registratore, il monitoraggio, le integrazioni e il livello gratuito a basso attrito lo rendono efficace nel dimostrare che una fonte consentita può supportare un flusso di lavoro utile.
Adottalo con disciplina di produzione: convalida schemi e completezza, calcola i crediti dalle pagine dei dettagli e dalla frequenza, isola le credenziali, abbrevia la conservazione, l'autorizzazione all'origine dei documenti e regola ogni esportazione. Il miglior robot non è semplicemente quello che continua a funzionare; è uno i cui dati rimangono accurati, autorizzati, tracciabili ed economici.
