Pada halaman ini
Pada 7 Julai 2026, robots.txt tidak lagi sekadar adab.
Itulah hari European Data Protection Board menerima pakai Guidelines 03/2026 mengenai web scraping dalam konteks AI generatif — kerangka GDPR komprehensif yang pertama untuk scraping berskala besar terhadap data yang tersedia secara awam bagi melatih model generatif. Bahagian ujian pengimbangannya membawa pendirian dengan akibat kejuruteraan yang langsung: robots.txt, ai.txt, CAPTCHA dan dinding log masuk ialah penunjuk tentang apa yang dijangkakan secara munasabah oleh subjek data. Abaikannya pada skala besar dan hujahnya bukan lagi tentang syarat perkhidmatan. Ia tentang Artikel 6(1)(f).
Setiap halaman yang mendapat ranking untuk "is web scraping legal" ialah firma guaman yang menulis untuk peguam lain. Ini versi untuk orang yang menulis crawler itu sendiri.
Ini bukan nasihat undang-undang. Ia bacaan kejuruteraan terhadap dokumen kawal selia yang telah diterbitkan. Guidelines 03/2026 sedang dalam konsultasi awam sehingga akhir Oktober 2026 dan versi muktamad tidak dijangka sebelum akhir 2026. Rujuk peguam sebelum melancarkan pipeline yang menyentuh data peribadi EU.
Isi kandungan
- Adakah web scraping sah pada 2026?
- Apakah yang berubah pada 7 Julai 2026?
- Adakah robots.txt kini mempunyai kuasa undang-undang?
- Asas undang-undang manakah yang benar-benar boleh anda gunakan?
- Scraping bersasar atau crawling tanpa sasaran?
- Apakah maksud peminimuman data dalam kod?
- Bagaimana jika anda scrape data kategori khas?
- Perlukah anda memberitahu orang bahawa anda scrape data mereka?
- Adakah anda pengawal atau pemproses?
- Bagaimanakah kedudukan AS berbeza?
- Apakah yang patut dilakukan pembangun scraper secara berbeza?
- Di mana kedudukan CrawlForge
Adakah web scraping sah pada 2026?
Ya, dengan syarat. Mengambil halaman yang boleh dicapai secara awam bukanlah menyalahi undang-undang dengan sendirinya di EU mahupun di AS. Kesahan bergantung pada apa yang anda kumpul, mengapa, dan apa yang berlaku selepas itu — dan di EU, mana-mana scrape yang menyentuh data peribadi ialah operasi pemprosesan yang memerlukan asas yang sah sebelum permintaan pertama dihantar.
Kedua-dua rejim ini bertanya soalan yang berbeza. EU bertanya apakah asas undang-undang anda dan sama ada anda boleh membuktikannya; AS tidak mempunyai statut scraping persekutuan, jadi undang-undang kontrak, hak cipta dan privasi peringkat negeri yang memainkan peranan itu.
Perkataan yang paling banyak mendatangkan kerosakan di sini ialah awam. "Tersedia secara awam" bukan kategori GDPR. Nama pada agenda persidangan, komen di bawah catatan blog, e-mel penyelenggara dalam commit — semuanya data peribadi, semuanya dalam skop. Pendirian EDPB ialah kandungan internet melibatkan data peribadi "hampir selalu", dan set data campuran tidak terlepas: bahagian data peribadinya kekal tertakluk kepada GDPR.
Apakah yang berubah pada 7 Julai 2026?
Sebelum Julai, pematuhan scraping di EU disusun secara analogi daripada panduan GDPR. Guidelines 03/2026 menggantikannya dengan kerangka yang disasarkan kepada latihan AI generatif.
| Perkara | Butiran |
|---|---|
| Diterima pakai | 7 Julai 2026, Versi 1.0 |
| Subjek | Web scraping dalam konteks AI generatif |
| Skop | Scraping oleh entiti swasta |
| Pencetus | Mana-mana scrape yang melibatkan data peribadi — "hampir selalu" bagi kandungan internet |
| Set data campuran | Bahagian data peribadi kekal tertakluk kepada GDPR |
| Konsultasi awam | Dibuka sehingga akhir Oktober 2026 |
| Versi muktamad | Tidak dijangka sebelum akhir 2026 |
Perkataannya masih boleh berubah, jadi jangan jadikannya kod tetap dalam program pematuhan anda. Tetapi obligasi yang ditafsirkannya ialah undang-undang sedia ada, boleh dikuatkuasakan sekarang — menunggu teks muktamad tidak memberi anda apa-apa.
Adakah robots.txt kini mempunyai kuasa undang-undang?
Tidak secara langsung. robots.txt ialah konvensyen, bukan statut, dan melangkauinya bukanlah satu kesalahan dengan sendirinya. Yang berubah ialah peranan pembuktiannya: EDPB menganggap robots.txt, ai.txt, CAPTCHA dan dinding log masuk sebagai penunjuk jangkaan munasabah subjek data, salah satu input kepada ujian pengimbangan kepentingan sah. Apabila sesebuah laman menggunakan isyarat tersebut dan menyatakan datanya tidak boleh digunakan untuk latihan AI, pendirian EDPB ialah subjek data tidak mempunyai jangkaan munasabah untuk di-scrape.
Mengabaikan Disallow dahulunya soal syarat perkhidmatan dan hak cipta yang boleh dihujahkan kemudian. Kini ia menimbang secara langsung terhadap anda dalam ujian yang menjadi sandaran keseluruhan asas undang-undang anda.
| Isyarat pada laman | Cara Guidelines 03/2026 membacanya | Apa yang patut dilakukan crawler anda |
|---|---|---|
robots.txt Disallow | Jangkaan untuk tidak di-crawl | Patuhinya secara lalai; log setiap langkauan |
ai.txt atau notis larangan latihan AI yang dinyatakan | Bantahan eksplisit terhadap penggunaan untuk latihan | Keluarkan domain itu daripada korpus latihan |
| CAPTCHA | Kawalan akses; memintasnya menimbang terhadap anda | Jangan selesaikannya secara programatik untuk membina korpus |
| Dinding log masuk | Kandungan tidak tersedia secara awam | Jangan log masuk semata-mata untuk menuai data |
Dua perkara sering dicampuradukkan di sini sedangkan tidak sepatutnya. Panduan stealth mode kami membincangkan browser fingerprinting pada halaman yang sedia terbuka kepada mana-mana pelawat. Dinding log masuk ialah perbuatan yang berbeza, dan sejak Julai 2026 ia membawa beban GDPR di samping pendedahan kontrak yang memang sedia ada.
Asas undang-undang manakah yang benar-benar boleh anda gunakan?
Persetujuan di bawah Artikel 6(1)(a) "secara amnya bukan asas undang-undang yang berdaya maju" untuk scraping pada skala besar, dalam kata-kata EDPB sendiri: anda tidak mungkin memperoleh persetujuan yang sah, spesifik dan diberikan secara bebas daripada berjuta-juta orang yang halaman mereka anda crawl. Yang tinggal ialah kepentingan sah di bawah Artikel 6(1)(f) — ujian kumulatif tiga bahagian, jadi gagal satu bahagian bermakna gagal keseluruhannya.
| Langkah | Apa yang ditanya | Apa yang perlu ada dalam rekod anda |
|---|---|---|
| 1. Kepentingan | Adakah ia sah, benar dan ditakrifkan dengan tepat? | Pernyataan tujuan bagi setiap korpus. EDPB menerima pembangunan ejen perbualan, pengesanan penipuan, dan pembangunan model AI secara umum |
| 2. Keperluan | Adakah wujud laluan yang kurang mengganggu tetapi sama berkesan? | Perbandingan bertulis alternatif yang anda tolak: kriteria lebih sempit, data sintetik, data terpseudonim |
| 3. Pengimbangan | Adakah hak dan jangkaan munasabah subjek data mengatasi kepentingan anda? | Rekod isyarat yang anda patuhi, domain yang anda keluarkan, cara opt-out dikendalikan |
Langkah 2 ialah yang paling dipandang ringan oleh pasukan kejuruteraan. "Kami memerlukan seluruh web" bukan hujah keperluan. Kriteria crawl yang lebih sempit, data sintetik dan pseudonimisasi semasa ingest semuanya dinamakan sebagai alternatif yang kurang mengganggu, dan jika anda tidak pernah menilainya, anda tiada rekod bahawa anda pernah mencuba.
Scraping bersasar atau crawling tanpa sasaran?
Garis panduan ini memisahkan scraping bersasar — kriteria terhad, domain atau topik tertentu — daripada crawling tanpa sasaran yang mengikuti pautan tanpa sekatan. Tanpa sasaran membawa risiko pematuhan yang lebih tinggi, kerana crawler tanpa sempadan tidak dapat menunjukkan bahawa pengumpulannya adalah perlu.
| Scraping bersasar | Crawling tanpa sasaran | |
|---|---|---|
| Definisi | Kriteria terhad; domain atau topik dinamakan | Pengikutan pautan tanpa sekatan |
| Risiko pematuhan | Lebih rendah | Lebih tinggi |
| Ujian keperluan | Lebih mudah dibuktikan | Sukar dibuktikan |
| Bentuk tipikal | Allowlist benih, corak include, had halaman | URL benih, had kedalaman, jalankan sehingga bajet habis |
Itu menjadikan konfigurasi crawl sebagai artifak pematuhan. Corak include, pengecualian dan had halaman anda ialah kriteria yang ditakrifkan dengan tepat yang ditanya oleh ujian keperluan, jadi ia wajar berada dalam kawalan versi.
import { Client } from '@modelcontextprotocol/sdk/client/index.js';
const client = new Client({ name: 'corpus-builder', version: '1.0.0' });
interface SourceRecord {
url: string;
domain: string;
collectedAt: string; // cap waktu ISO — diperlukan untuk senarai sumber awam
}
// Crawl bersasar: domain dinamakan, corak include eksplisit, had halaman tegas.
const result = await client.callTool({
name: 'crawl_deep',
arguments: {
url: 'https://docs.python.org/3/',
max_pages: 500,
respect_robots: true, // lalai; mematikannya ialah keputusan yang perlu anda justifikasikan
include_patterns: ['/3/library/', '/3/tutorial/'],
exclude_patterns: ['/genindex', '/search'],
},
});
const payload = result.content as Array<{ text: string }>;
const crawled = JSON.parse(payload[0].text) as { pages: Array<{ url: string }> };
// Artikel 14 menjangkakan senarai sumber yang selengkap mungkin, sebaiknya
// dengan tarikh pengumpulan. Itu menjadikan provenans satu keperluan skema.
const provenance: SourceRecord[] = crawled.pages.map((page) => ({
url: page.url,
domain: new URL(page.url).hostname,
collectedAt: new Date().toISOString(),
}));Apakah maksud peminimuman data dalam kod?
Garis panduan ini menetapkan peminimuman pada tiga titik, dan setiap satunya terpeta ke satu tempat dalam stack anda.
Sebelum pengumpulan. Kriteria yang tepat, kategori laman yang sensitif secara struktur dikecualikan terus, robots.txt dan ai.txt dipatuhi, data sintetik dipertimbangkan. Ini kerja senarai benih dan konfigurasi crawl.
Semasa dan selepas pengumpulan. Penapis berasaskan sintaks untuk pengecam — nombor keselamatan sosial ialah contoh EDPB sendiri — kemudian pseudonimisasi atau anonimisasi. Ini tempatnya dalam laluan ingest, sebelum apa-apa sampai ke storan kekal.
// Penapis sintaks berjalan sebelum apa-apa sampai ke storan kekal. Ia sengaja
// kasar: ia menukar recall dengan rekod peminimuman yang boleh anda tunjukkan.
const IDENTIFIER_PATTERNS: Array<{ label: string; pattern: RegExp }> = [
{ label: 'us-ssn', pattern: /d{3}-d{2}-d{4}/g },
{ label: 'email', pattern: /[w.+-]+@[w-]+.[w.]{2,}/g },
];
interface RedactionResult {
text: string;
hits: Record<string, number>;
}
export function redactIdentifiers(input: string): RedactionResult {
const hits: Record<string, number> = {};
let text = input;
for (const { label, pattern } of IDENTIFIER_PATTERNS) {
const matches = text.match(pattern);
if (matches) {
hits[label] = matches.length;
text = text.replace(pattern, '[REDACTED:' + label + ']');
}
}
// Simpan kiraan ini. Ia bukti akauntabiliti, bukan output nyahpepijat.
return { text, hits };
}Penapis regex terlepas banyak perkara: nama, alamat dan pendedahan dalam teks bebas lolos begitu sahaja. Dokumentasikan hakikat itu dan jangan mendakwa korpus itu bersih — matlamatnya ialah pengurangan yang boleh ditunjukkan, bukan kesempurnaan.
Bagaimana jika anda scrape data kategori khas?
Data Artikel 9 — kesihatan, pandangan politik, etnik — muncul secara tidak sengaja dalam mana-mana crawl yang luas. Pendirian EDPB ialah pengumpulan tidak sengaja tidak secara automatik menyalahi undang-undang, tetapi hanya bertahan dengan langkah perlindungan merentasi keseluruhan kitaran hayat model. Garis panduan ini menyandarkannya pada keputusan CJEU dalam GC and Others (C-136/17).
| Peringkat kitaran hayat | Langkah perlindungan | Di mana ia berada |
|---|---|---|
| Sebelum pengumpulan | Tapis keluar sumber dan kandungan yang berkemungkinan membawa data Artikel 9 | Senarai benih dan konfigurasi crawl |
| Selepas pengumpulan | Padam dengan segera apa yang terlepas masuk | Pipeline ingest dan tugas pengekalan |
| Semasa pembangunan model | Uji bahawa model menahan pengekstrakan data tersebut | Suite penilaian |
| Selepas pelancaran | Pantau output untuk kebocoran | Telemetri produksi |
Itu empat pemilik yang berbeza. Naratif pematuhan yang berhenti pada ingest hanya meliputi satu perempat daripada apa yang diperlukan.
Perlukah anda memberitahu orang bahawa anda scrape data mereka?
Secara individu, biasanya tidak. Artikel 14(5)(b) mengecualikan notis langsung apabila ia melibatkan usaha yang tidak seimbang, dan memberitahu setiap orang yang terwakil dalam korpus berskala web memenuhi syarat itu. Ia bukan lesen bebas: anda tetap mesti menerbitkan notis privasi awam yang merangkumi kategori data, tujuan, asas undang-undang, dan senarai sumber yang selengkap mungkin — sebaiknya nama domain yang boleh dicari beserta tarikh pengumpulan. Mekanisme opt-out pra-pengumpulan dinamakan sebagai amalan baik.
Keperluan terakhir itu ialah keputusan skema yang menyamar sebagai keputusan undang-undang. Jika crawler tidak merekodkan domain sumber dan tarikh pengumpulan bagi setiap rekod, anda tidak akan dapat menghasilkan halaman itu kemudian, dan membina semula provenans merentasi ratusan juta dokumen bukanlah sesuatu yang realistik. Dua lajur pada masa tulis, seperti dalam SourceRecord di atas.
Adakah anda pengawal atau pemproses?
Entiti yang menjalankan scraper tidak secara automatik menjadi pengawal, dan perbezaan ini menentukan siapa yang memikul semua yang di atas.
- Scraping mengikut arahan yang didokumenkan — sasaran, kriteria dan tujuan ditetapkan oleh klien — kelihatan seperti pemprosesan. Dapatkan arahan itu secara bertulis; itulah yang menjadikan peranan tersebut boleh dipertahankan.
- Memilih sasaran dan tujuan anda sendiri menjadikan anda pengawal, termasuk apabila anda kemudiannya menjual atau menerbitkan korpus itu.
- Menggunakan semula set data yang di-scrape oleh orang lain meninggalkan setiap pihak bertanggungjawab atas pemprosesannya sendiri, melainkan anda menentukan tujuan dan cara secara bersama.
Jika anda menjual scraping sebagai perkhidmatan, jurang antara "pelanggan yang menetapkan domain" dan "kami yang memilih domain" ialah jurang antara obligasi pemproses dan obligasi pengawal.
Bagaimanakah kedudukan AS berbeza?
Tiada statut web scraping persekutuan di AS. Tuntutan Computer Fraud and Abuse Act yang menyasarkan scraping data yang boleh diakses secara awam telah berulang kali gagal, dengan rangkaian kes hiQ v. LinkedIn sebagai contoh yang terkenal. Itu tidak menjadikan scraping di AS tanpa peraturan: syarat kontrak, hak cipta dan statut privasi peringkat negeri yang membawa pendedahannya.
Hak cipta ialah barisan hadapan yang aktif bagi latihan AI. Analisis Mei 2026 oleh Ropes & Gray mencatatkan bahawa menggunakan data yang di-scrape untuk melatih model, dan untuk menjana retrieval-augmented generation, boleh melibatkan hak pengeluaran semula di bawah undang-undang hak cipta AS, dengan merujuk laporan 2024 U.S. Copyright Office.
| Soalan | EU (GDPR + Guidelines 03/2026) | AS |
|---|---|---|
| Peraturan yang mentadbir | GDPR; ujian kepentingan sah Artikel 6(1)(f) | Tiada statut scraping persekutuan |
| Akses kepada data awam | Asas sah diperlukan walaupun aksesnya awam | Tuntutan CFAA telah berulang kali gagal (rangkaian kes hiQ) |
robots.txt | Bukti dalam ujian pengimbangan | Dibingkai melalui kontrak dan syarat perkhidmatan |
| Penggunaan untuk latihan | Tujuan mesti melepasi ujian keperluan dan pengimbangan | Hak pengeluaran semula mungkin terlibat |
| Ketelusan | Notis privasi awam dengan senarai sumber | Tiada kewajipan pendedahan scraping yang umum |
Bagi pasukan yang melancar secara global, analisis EU ialah superset yang ketat: bina untuk memenuhi Guidelines 03/2026 dan soalan AS yang tinggal hanyalah tentang pelesenan dan syarat, bukan seni bina.
Apakah yang patut dilakukan pembangun scraper secara berbeza?
[ ] Rekodkan domain sumber + cap waktu pengumpulan bagi setiap rekod yang disimpan
[ ] Patuhi robots.txt dan ai.txt secara lalai; log setiap keputusan langkauan
[ ] Jangan sekali-kali log masuk atau menyelesaikan CAPTCHA untuk membina korpus latihan
[ ] Utamakan crawl dengan corak include berbanding pengikutan pautan tanpa sekatan
[ ] Simpan kriteria crawl dalam kawalan versi — ia bukti keperluan anda
[ ] Tuliskan alternatif yang anda tolak (sintetik, lebih sempit, terpseudonim)
[ ] Kecualikan kategori laman yang sensitif secara struktur pada senarai benih
[ ] Tapis dan pseudonimkan pengecam sebelum apa-apa sampai ke storan kekal
[ ] Terbitkan notis privasi: kategori, tujuan, asas undang-undang, senarai sumber
[ ] Sediakan opt-out pra-pengumpulan dan patuhinya dalam senarai benih
Pecahan garis panduan ini oleh Reed Smith mengesyorkan bermula dengan analisis jurang terhadap ujian tiga bahagian itu — wajar, kerana kebanyakan jurang tersebut rupanya soal pengelogan dan dokumentasi, bukan kod. Jika anda sedang menyusun korpus latihan, panduan web scraping untuk data latihan AI kami merangkumi sisi pipeline bagi masalah yang sama.
Di mana kedudukan CrawlForge
Secara jujur: ia mengendalikan bahagian mekanikal, dan bukan bahagian pertimbangan.
Alat crawling menghormati robots.txt secara lalai — crawl_deep menerima respect_robots bagi setiap panggilan, dan pelayan membaca RESPECT_ROBOTS_TXT untuk lalai global. Mematikan pematuhan itu memang boleh dilakukan, dan sejak Julai 2026 itu ialah keputusan yang wajar direkodkan bersama sebabnya. Pengehadan kadar bersopan secara lalai, dan alat-alat ini mengambil halaman yang boleh diakses secara awam — tiada pemintasan dinding log masuk. Kawalan akses dan perlindungan SSRF dihidupkan secara lalai, atas sebab yang dibincangkan dalam tulisan kami mengenai SSRF dalam pelayan MCP.
Apa yang tidak dilakukan oleh mana-mana alat ialah menjadikan pipeline yang menyalahi undang-undang menjadi sah. Tiada satu pun daripada 27 alat itu memilih asas undang-undang anda, menulis notis privasi anda, mendokumenkan alternatif yang anda tolak, atau memutuskan sama ada korpus anda memerlukan domain itu. Itu obligasi pengendali, dan Guidelines 03/2026 meletakkannya pada pengawal.
Membina pipeline AI atas data web langsung? Mula percuma dengan 1,000 credits — robots.txt dipatuhi secara lalai merentasi 27 alat, tiada kad diperlukan. Lihat dokumentasi atau panduan web scraping untuk data latihan AI.
Cuba sendiri — tiada pendaftaran diperlukan
Jalankan mana-mana daripada 28 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.
1,000 credits percuma • Sekali sahaja • Tiada kad kredit diperlukan
Tag
Tentang Penulis
Kekal dikemas kini dengan pandangan terkini
Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.
Tiada spam. Berhenti melanggan bila-bila masa.