CrawlForge MCP
Laman UtamaPlaygroundKes PenggunaanIntegrasiHargaDokumentasiBlog
Adakah Web Scraping Sah pada 2026? Peraturan AI Baharu EDPB
Web Scraping
Kembali ke Blog
Web Scraping

Adakah Web Scraping Sah pada 2026? Peraturan AI Baharu EDPB

C
CrawlForge Team
Pasukan Kejuruteraan
20 Ogos 2026
13 min bacaan

Pada halaman ini

Jawapan Pantas

Pada 7 Julai 2026, European Data Protection Board menerima pakai Guidelines 03/2026, kerangka GDPR komprehensif yang pertama untuk scraping data yang tersedia secara awam bagi melatih AI generatif. Scraping kekal sah, tetapi garis panduan ini menolak persetujuan sebagai asas yang boleh digunakan pada skala besar dan menyalurkan segala-galanya melalui ujian kepentingan sah Artikel 6(1)(f): kepentingan yang tepat, semakan keperluan terhadap alternatif yang kurang mengganggu, dan ujian pengimbangan. Perubahan yang sampai ke kod anda ialah robots.txt, ai.txt, CAPTCHA dan dinding log masuk kini dikira sebagai bukti tentang apa yang dijangkakan secara munasabah oleh subjek data. Konsultasi awam berjalan sehingga akhir Oktober 2026; teks muktamad tidak dijangka sebelum akhir 2026.

Pada 7 Julai 2026, robots.txt tidak lagi sekadar adab.

Itulah hari European Data Protection Board menerima pakai Guidelines 03/2026 mengenai web scraping dalam konteks AI generatif — kerangka GDPR komprehensif yang pertama untuk scraping berskala besar terhadap data yang tersedia secara awam bagi melatih model generatif. Bahagian ujian pengimbangannya membawa pendirian dengan akibat kejuruteraan yang langsung: robots.txt, ai.txt, CAPTCHA dan dinding log masuk ialah penunjuk tentang apa yang dijangkakan secara munasabah oleh subjek data. Abaikannya pada skala besar dan hujahnya bukan lagi tentang syarat perkhidmatan. Ia tentang Artikel 6(1)(f).

Setiap halaman yang mendapat ranking untuk "is web scraping legal" ialah firma guaman yang menulis untuk peguam lain. Ini versi untuk orang yang menulis crawler itu sendiri.

Ini bukan nasihat undang-undang. Ia bacaan kejuruteraan terhadap dokumen kawal selia yang telah diterbitkan. Guidelines 03/2026 sedang dalam konsultasi awam sehingga akhir Oktober 2026 dan versi muktamad tidak dijangka sebelum akhir 2026. Rujuk peguam sebelum melancarkan pipeline yang menyentuh data peribadi EU.

Isi kandungan

  • Adakah web scraping sah pada 2026?
  • Apakah yang berubah pada 7 Julai 2026?
  • Adakah robots.txt kini mempunyai kuasa undang-undang?
  • Asas undang-undang manakah yang benar-benar boleh anda gunakan?
  • Scraping bersasar atau crawling tanpa sasaran?
  • Apakah maksud peminimuman data dalam kod?
  • Bagaimana jika anda scrape data kategori khas?
  • Perlukah anda memberitahu orang bahawa anda scrape data mereka?
  • Adakah anda pengawal atau pemproses?
  • Bagaimanakah kedudukan AS berbeza?
  • Apakah yang patut dilakukan pembangun scraper secara berbeza?
  • Di mana kedudukan CrawlForge

Adakah web scraping sah pada 2026?

Ya, dengan syarat. Mengambil halaman yang boleh dicapai secara awam bukanlah menyalahi undang-undang dengan sendirinya di EU mahupun di AS. Kesahan bergantung pada apa yang anda kumpul, mengapa, dan apa yang berlaku selepas itu — dan di EU, mana-mana scrape yang menyentuh data peribadi ialah operasi pemprosesan yang memerlukan asas yang sah sebelum permintaan pertama dihantar.

Kedua-dua rejim ini bertanya soalan yang berbeza. EU bertanya apakah asas undang-undang anda dan sama ada anda boleh membuktikannya; AS tidak mempunyai statut scraping persekutuan, jadi undang-undang kontrak, hak cipta dan privasi peringkat negeri yang memainkan peranan itu.

Perkataan yang paling banyak mendatangkan kerosakan di sini ialah awam. "Tersedia secara awam" bukan kategori GDPR. Nama pada agenda persidangan, komen di bawah catatan blog, e-mel penyelenggara dalam commit — semuanya data peribadi, semuanya dalam skop. Pendirian EDPB ialah kandungan internet melibatkan data peribadi "hampir selalu", dan set data campuran tidak terlepas: bahagian data peribadinya kekal tertakluk kepada GDPR.

Apakah yang berubah pada 7 Julai 2026?

Sebelum Julai, pematuhan scraping di EU disusun secara analogi daripada panduan GDPR. Guidelines 03/2026 menggantikannya dengan kerangka yang disasarkan kepada latihan AI generatif.

PerkaraButiran
Diterima pakai7 Julai 2026, Versi 1.0
SubjekWeb scraping dalam konteks AI generatif
SkopScraping oleh entiti swasta
PencetusMana-mana scrape yang melibatkan data peribadi — "hampir selalu" bagi kandungan internet
Set data campuranBahagian data peribadi kekal tertakluk kepada GDPR
Konsultasi awamDibuka sehingga akhir Oktober 2026
Versi muktamadTidak dijangka sebelum akhir 2026

Perkataannya masih boleh berubah, jadi jangan jadikannya kod tetap dalam program pematuhan anda. Tetapi obligasi yang ditafsirkannya ialah undang-undang sedia ada, boleh dikuatkuasakan sekarang — menunggu teks muktamad tidak memberi anda apa-apa.

Adakah robots.txt kini mempunyai kuasa undang-undang?

Tidak secara langsung. robots.txt ialah konvensyen, bukan statut, dan melangkauinya bukanlah satu kesalahan dengan sendirinya. Yang berubah ialah peranan pembuktiannya: EDPB menganggap robots.txt, ai.txt, CAPTCHA dan dinding log masuk sebagai penunjuk jangkaan munasabah subjek data, salah satu input kepada ujian pengimbangan kepentingan sah. Apabila sesebuah laman menggunakan isyarat tersebut dan menyatakan datanya tidak boleh digunakan untuk latihan AI, pendirian EDPB ialah subjek data tidak mempunyai jangkaan munasabah untuk di-scrape.

Mengabaikan Disallow dahulunya soal syarat perkhidmatan dan hak cipta yang boleh dihujahkan kemudian. Kini ia menimbang secara langsung terhadap anda dalam ujian yang menjadi sandaran keseluruhan asas undang-undang anda.

Isyarat pada lamanCara Guidelines 03/2026 membacanyaApa yang patut dilakukan crawler anda
robots.txt DisallowJangkaan untuk tidak di-crawlPatuhinya secara lalai; log setiap langkauan
ai.txt atau notis larangan latihan AI yang dinyatakanBantahan eksplisit terhadap penggunaan untuk latihanKeluarkan domain itu daripada korpus latihan
CAPTCHAKawalan akses; memintasnya menimbang terhadap andaJangan selesaikannya secara programatik untuk membina korpus
Dinding log masukKandungan tidak tersedia secara awamJangan log masuk semata-mata untuk menuai data

Dua perkara sering dicampuradukkan di sini sedangkan tidak sepatutnya. Panduan stealth mode kami membincangkan browser fingerprinting pada halaman yang sedia terbuka kepada mana-mana pelawat. Dinding log masuk ialah perbuatan yang berbeza, dan sejak Julai 2026 ia membawa beban GDPR di samping pendedahan kontrak yang memang sedia ada.

Asas undang-undang manakah yang benar-benar boleh anda gunakan?

Persetujuan di bawah Artikel 6(1)(a) "secara amnya bukan asas undang-undang yang berdaya maju" untuk scraping pada skala besar, dalam kata-kata EDPB sendiri: anda tidak mungkin memperoleh persetujuan yang sah, spesifik dan diberikan secara bebas daripada berjuta-juta orang yang halaman mereka anda crawl. Yang tinggal ialah kepentingan sah di bawah Artikel 6(1)(f) — ujian kumulatif tiga bahagian, jadi gagal satu bahagian bermakna gagal keseluruhannya.

LangkahApa yang ditanyaApa yang perlu ada dalam rekod anda
1. KepentinganAdakah ia sah, benar dan ditakrifkan dengan tepat?Pernyataan tujuan bagi setiap korpus. EDPB menerima pembangunan ejen perbualan, pengesanan penipuan, dan pembangunan model AI secara umum
2. KeperluanAdakah wujud laluan yang kurang mengganggu tetapi sama berkesan?Perbandingan bertulis alternatif yang anda tolak: kriteria lebih sempit, data sintetik, data terpseudonim
3. PengimbanganAdakah hak dan jangkaan munasabah subjek data mengatasi kepentingan anda?Rekod isyarat yang anda patuhi, domain yang anda keluarkan, cara opt-out dikendalikan

Langkah 2 ialah yang paling dipandang ringan oleh pasukan kejuruteraan. "Kami memerlukan seluruh web" bukan hujah keperluan. Kriteria crawl yang lebih sempit, data sintetik dan pseudonimisasi semasa ingest semuanya dinamakan sebagai alternatif yang kurang mengganggu, dan jika anda tidak pernah menilainya, anda tiada rekod bahawa anda pernah mencuba.

Scraping bersasar atau crawling tanpa sasaran?

Garis panduan ini memisahkan scraping bersasar — kriteria terhad, domain atau topik tertentu — daripada crawling tanpa sasaran yang mengikuti pautan tanpa sekatan. Tanpa sasaran membawa risiko pematuhan yang lebih tinggi, kerana crawler tanpa sempadan tidak dapat menunjukkan bahawa pengumpulannya adalah perlu.

Scraping bersasarCrawling tanpa sasaran
DefinisiKriteria terhad; domain atau topik dinamakanPengikutan pautan tanpa sekatan
Risiko pematuhanLebih rendahLebih tinggi
Ujian keperluanLebih mudah dibuktikanSukar dibuktikan
Bentuk tipikalAllowlist benih, corak include, had halamanURL benih, had kedalaman, jalankan sehingga bajet habis

Itu menjadikan konfigurasi crawl sebagai artifak pematuhan. Corak include, pengecualian dan had halaman anda ialah kriteria yang ditakrifkan dengan tepat yang ditanya oleh ujian keperluan, jadi ia wajar berada dalam kawalan versi.

Typescript
import { Client } from '@modelcontextprotocol/sdk/client/index.js';

const client = new Client({ name: 'corpus-builder', version: '1.0.0' });

interface SourceRecord {
  url: string;
  domain: string;
  collectedAt: string; // cap waktu ISO — diperlukan untuk senarai sumber awam
}

// Crawl bersasar: domain dinamakan, corak include eksplisit, had halaman tegas.
const result = await client.callTool({
  name: 'crawl_deep',
  arguments: {
    url: 'https://docs.python.org/3/',
    max_pages: 500,
    respect_robots: true, // lalai; mematikannya ialah keputusan yang perlu anda justifikasikan
    include_patterns: ['/3/library/', '/3/tutorial/'],
    exclude_patterns: ['/genindex', '/search'],
  },
});

const payload = result.content as Array<{ text: string }>;
const crawled = JSON.parse(payload[0].text) as { pages: Array<{ url: string }> };

// Artikel 14 menjangkakan senarai sumber yang selengkap mungkin, sebaiknya
// dengan tarikh pengumpulan. Itu menjadikan provenans satu keperluan skema.
const provenance: SourceRecord[] = crawled.pages.map((page) => ({
  url: page.url,
  domain: new URL(page.url).hostname,
  collectedAt: new Date().toISOString(),
}));

Apakah maksud peminimuman data dalam kod?

Garis panduan ini menetapkan peminimuman pada tiga titik, dan setiap satunya terpeta ke satu tempat dalam stack anda.

Sebelum pengumpulan. Kriteria yang tepat, kategori laman yang sensitif secara struktur dikecualikan terus, robots.txt dan ai.txt dipatuhi, data sintetik dipertimbangkan. Ini kerja senarai benih dan konfigurasi crawl.

Semasa dan selepas pengumpulan. Penapis berasaskan sintaks untuk pengecam — nombor keselamatan sosial ialah contoh EDPB sendiri — kemudian pseudonimisasi atau anonimisasi. Ini tempatnya dalam laluan ingest, sebelum apa-apa sampai ke storan kekal.

Typescript
// Penapis sintaks berjalan sebelum apa-apa sampai ke storan kekal. Ia sengaja
// kasar: ia menukar recall dengan rekod peminimuman yang boleh anda tunjukkan.
const IDENTIFIER_PATTERNS: Array<{ label: string; pattern: RegExp }> = [
  { label: 'us-ssn', pattern: /d{3}-d{2}-d{4}/g },
  { label: 'email', pattern: /[w.+-]+@[w-]+.[w.]{2,}/g },
];

interface RedactionResult {
  text: string;
  hits: Record<string, number>;
}

export function redactIdentifiers(input: string): RedactionResult {
  const hits: Record<string, number> = {};
  let text = input;

  for (const { label, pattern } of IDENTIFIER_PATTERNS) {
    const matches = text.match(pattern);
    if (matches) {
      hits[label] = matches.length;
      text = text.replace(pattern, '[REDACTED:' + label + ']');
    }
  }

  // Simpan kiraan ini. Ia bukti akauntabiliti, bukan output nyahpepijat.
  return { text, hits };
}

Penapis regex terlepas banyak perkara: nama, alamat dan pendedahan dalam teks bebas lolos begitu sahaja. Dokumentasikan hakikat itu dan jangan mendakwa korpus itu bersih — matlamatnya ialah pengurangan yang boleh ditunjukkan, bukan kesempurnaan.

Bagaimana jika anda scrape data kategori khas?

Data Artikel 9 — kesihatan, pandangan politik, etnik — muncul secara tidak sengaja dalam mana-mana crawl yang luas. Pendirian EDPB ialah pengumpulan tidak sengaja tidak secara automatik menyalahi undang-undang, tetapi hanya bertahan dengan langkah perlindungan merentasi keseluruhan kitaran hayat model. Garis panduan ini menyandarkannya pada keputusan CJEU dalam GC and Others (C-136/17).

Peringkat kitaran hayatLangkah perlindunganDi mana ia berada
Sebelum pengumpulanTapis keluar sumber dan kandungan yang berkemungkinan membawa data Artikel 9Senarai benih dan konfigurasi crawl
Selepas pengumpulanPadam dengan segera apa yang terlepas masukPipeline ingest dan tugas pengekalan
Semasa pembangunan modelUji bahawa model menahan pengekstrakan data tersebutSuite penilaian
Selepas pelancaranPantau output untuk kebocoranTelemetri produksi

Itu empat pemilik yang berbeza. Naratif pematuhan yang berhenti pada ingest hanya meliputi satu perempat daripada apa yang diperlukan.

Perlukah anda memberitahu orang bahawa anda scrape data mereka?

Secara individu, biasanya tidak. Artikel 14(5)(b) mengecualikan notis langsung apabila ia melibatkan usaha yang tidak seimbang, dan memberitahu setiap orang yang terwakil dalam korpus berskala web memenuhi syarat itu. Ia bukan lesen bebas: anda tetap mesti menerbitkan notis privasi awam yang merangkumi kategori data, tujuan, asas undang-undang, dan senarai sumber yang selengkap mungkin — sebaiknya nama domain yang boleh dicari beserta tarikh pengumpulan. Mekanisme opt-out pra-pengumpulan dinamakan sebagai amalan baik.

Keperluan terakhir itu ialah keputusan skema yang menyamar sebagai keputusan undang-undang. Jika crawler tidak merekodkan domain sumber dan tarikh pengumpulan bagi setiap rekod, anda tidak akan dapat menghasilkan halaman itu kemudian, dan membina semula provenans merentasi ratusan juta dokumen bukanlah sesuatu yang realistik. Dua lajur pada masa tulis, seperti dalam SourceRecord di atas.

Adakah anda pengawal atau pemproses?

Entiti yang menjalankan scraper tidak secara automatik menjadi pengawal, dan perbezaan ini menentukan siapa yang memikul semua yang di atas.

  • Scraping mengikut arahan yang didokumenkan — sasaran, kriteria dan tujuan ditetapkan oleh klien — kelihatan seperti pemprosesan. Dapatkan arahan itu secara bertulis; itulah yang menjadikan peranan tersebut boleh dipertahankan.
  • Memilih sasaran dan tujuan anda sendiri menjadikan anda pengawal, termasuk apabila anda kemudiannya menjual atau menerbitkan korpus itu.
  • Menggunakan semula set data yang di-scrape oleh orang lain meninggalkan setiap pihak bertanggungjawab atas pemprosesannya sendiri, melainkan anda menentukan tujuan dan cara secara bersama.

Jika anda menjual scraping sebagai perkhidmatan, jurang antara "pelanggan yang menetapkan domain" dan "kami yang memilih domain" ialah jurang antara obligasi pemproses dan obligasi pengawal.

Bagaimanakah kedudukan AS berbeza?

Tiada statut web scraping persekutuan di AS. Tuntutan Computer Fraud and Abuse Act yang menyasarkan scraping data yang boleh diakses secara awam telah berulang kali gagal, dengan rangkaian kes hiQ v. LinkedIn sebagai contoh yang terkenal. Itu tidak menjadikan scraping di AS tanpa peraturan: syarat kontrak, hak cipta dan statut privasi peringkat negeri yang membawa pendedahannya.

Hak cipta ialah barisan hadapan yang aktif bagi latihan AI. Analisis Mei 2026 oleh Ropes & Gray mencatatkan bahawa menggunakan data yang di-scrape untuk melatih model, dan untuk menjana retrieval-augmented generation, boleh melibatkan hak pengeluaran semula di bawah undang-undang hak cipta AS, dengan merujuk laporan 2024 U.S. Copyright Office.

SoalanEU (GDPR + Guidelines 03/2026)AS
Peraturan yang mentadbirGDPR; ujian kepentingan sah Artikel 6(1)(f)Tiada statut scraping persekutuan
Akses kepada data awamAsas sah diperlukan walaupun aksesnya awamTuntutan CFAA telah berulang kali gagal (rangkaian kes hiQ)
robots.txtBukti dalam ujian pengimbanganDibingkai melalui kontrak dan syarat perkhidmatan
Penggunaan untuk latihanTujuan mesti melepasi ujian keperluan dan pengimbanganHak pengeluaran semula mungkin terlibat
KetelusanNotis privasi awam dengan senarai sumberTiada kewajipan pendedahan scraping yang umum

Bagi pasukan yang melancar secara global, analisis EU ialah superset yang ketat: bina untuk memenuhi Guidelines 03/2026 dan soalan AS yang tinggal hanyalah tentang pelesenan dan syarat, bukan seni bina.

Apakah yang patut dilakukan pembangun scraper secara berbeza?

[ ] Rekodkan domain sumber + cap waktu pengumpulan bagi setiap rekod yang disimpan [ ] Patuhi robots.txt dan ai.txt secara lalai; log setiap keputusan langkauan [ ] Jangan sekali-kali log masuk atau menyelesaikan CAPTCHA untuk membina korpus latihan [ ] Utamakan crawl dengan corak include berbanding pengikutan pautan tanpa sekatan [ ] Simpan kriteria crawl dalam kawalan versi — ia bukti keperluan anda [ ] Tuliskan alternatif yang anda tolak (sintetik, lebih sempit, terpseudonim) [ ] Kecualikan kategori laman yang sensitif secara struktur pada senarai benih [ ] Tapis dan pseudonimkan pengecam sebelum apa-apa sampai ke storan kekal [ ] Terbitkan notis privasi: kategori, tujuan, asas undang-undang, senarai sumber [ ] Sediakan opt-out pra-pengumpulan dan patuhinya dalam senarai benih

Pecahan garis panduan ini oleh Reed Smith mengesyorkan bermula dengan analisis jurang terhadap ujian tiga bahagian itu — wajar, kerana kebanyakan jurang tersebut rupanya soal pengelogan dan dokumentasi, bukan kod. Jika anda sedang menyusun korpus latihan, panduan web scraping untuk data latihan AI kami merangkumi sisi pipeline bagi masalah yang sama.

Di mana kedudukan CrawlForge

Secara jujur: ia mengendalikan bahagian mekanikal, dan bukan bahagian pertimbangan.

Alat crawling menghormati robots.txt secara lalai — crawl_deep menerima respect_robots bagi setiap panggilan, dan pelayan membaca RESPECT_ROBOTS_TXT untuk lalai global. Mematikan pematuhan itu memang boleh dilakukan, dan sejak Julai 2026 itu ialah keputusan yang wajar direkodkan bersama sebabnya. Pengehadan kadar bersopan secara lalai, dan alat-alat ini mengambil halaman yang boleh diakses secara awam — tiada pemintasan dinding log masuk. Kawalan akses dan perlindungan SSRF dihidupkan secara lalai, atas sebab yang dibincangkan dalam tulisan kami mengenai SSRF dalam pelayan MCP.

Apa yang tidak dilakukan oleh mana-mana alat ialah menjadikan pipeline yang menyalahi undang-undang menjadi sah. Tiada satu pun daripada 27 alat itu memilih asas undang-undang anda, menulis notis privasi anda, mendokumenkan alternatif yang anda tolak, atau memutuskan sama ada korpus anda memerlukan domain itu. Itu obligasi pengendali, dan Guidelines 03/2026 meletakkannya pada pengawal.


Membina pipeline AI atas data web langsung? Mula percuma dengan 1,000 credits — robots.txt dipatuhi secara lalai merentasi 27 alat, tiada kad diperlukan. Lihat dokumentasi atau panduan web scraping untuk data latihan AI.

Cuba sendiri — tiada pendaftaran diperlukan

Jalankan mana-mana daripada 28 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.

1,000 credits percuma • Sekali sahaja • Tiada kad kredit diperlukan

Tag

legalcomplianceGDPRweb-scrapingAI training

Tentang Penulis

C

CrawlForge Team

Pasukan Kejuruteraan

Membina MCP server web scraping yang paling menyeluruh. Kami mencipta alatan yang membantu pembangun mengekstrak, menganalisis dan mengubah data web untuk aplikasi AI.

Kekal dikemas kini dengan pandangan terkini

Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.

Tiada spam. Berhenti melanggan bila-bila masa.

Praktikkan ini

Uji alat CrawlForge pada mana-mana URL — percuma, tanpa pendaftaran.

Pada halaman ini

Frequently Asked Questions

Adakah garis panduan EDPB sudah terpakai, atau hanya setelah muktamad?+

Guidelines 03/2026 diterima pakai pada 7 Julai 2026 sebagai Versi 1.0 dan dibuka untuk konsultasi awam sehingga akhir Oktober 2026, dengan versi muktamad tidak dijangka sebelum akhir 2026. Perkataannya masih boleh berubah. Namun, obligasi yang ditafsirkannya ialah undang-undang GDPR sedia ada dan boleh dikuatkuasakan hari ini — garis panduan ini menerangkan cara pihak berkuasa penyeliaan berkemungkinan membaca Artikel 6, 9 dan 14 bagi scrape latihan AI. Membina mengikut draf adalah munasabah; menganggapnya tidak terpakai sehingga muktamad adalah tidak munasabah, kerana kewajipan undang-undang asasnya tidak bergantung pada draf itu.

Adakah data yang tersedia secara awam terkecuali daripada GDPR?+

Tidak. Kebolehcapaian awam bukan pengecualian GDPR dan "tersedia secara awam" bukan kategori undang-undang di bawah peraturan itu. Jika kandungan mengenal pasti orang yang masih hidup — nama dalam catatan forum, e-mel dalam commit, kapsyen foto — ia data peribadi dan pemprosesannya memerlukan asas yang sah. EDPB menyatakan bahawa data peribadi terlibat dalam kandungan internet hampir selalu. Set data campuran yang mengandungi kedua-dua data peribadi dan bukan peribadi juga tidak terlepas: bahagian data peribadinya kekal tertakluk sepenuhnya kepada GDPR tanpa mengira berapa banyak kandungan bukan peribadi yang mengelilinginya.

Bolehkah saya menggunakan persetujuan sebagai asas undang-undang untuk scraping data latihan?+

Tidak pada skala besar. EDPB menyatakan bahawa persetujuan di bawah Artikel 6(1)(a) secara amnya bukan asas undang-undang yang berdaya maju untuk scraping berskala besar, kerana persetujuan yang sah mesti diberikan secara bebas, spesifik dan bermaklumat — mustahil diperoleh daripada berjuta-juta orang yang terwakil dalam korpus berskala web. Kepentingan sah di bawah Artikel 6(1)(f) ialah laluan utama sebagai gantinya. Ia memerlukan ujian kumulatif tiga bahagian: kepentingan yang sah, benar dan ditakrifkan dengan tepat; keperluan, bermaksud tiada alternatif yang kurang mengganggu tetapi sama berkesan; dan ujian pengimbangan terhadap hak dan jangkaan munasabah subjek data.

Adakah mengabaikan robots.txt menjadikan crawl saya menyalahi undang-undang?+

Tidak secara automatik, dan tidak dengan sendirinya. robots.txt ialah konvensyen dan bukan perundangan, jadi mengabaikannya bukanlah satu kesalahan dengan sendirinya. Di bawah Guidelines 03/2026 ia menjadi bukti: robots.txt, ai.txt, CAPTCHA dan dinding log masuk dibaca sebagai penunjuk jangkaan munasabah subjek data, iaitu input langsung kepada ujian pengimbangan Artikel 6(1)(f). Apabila sesebuah laman menerbitkan isyarat tersebut dan menyatakan datanya tidak boleh digunakan untuk latihan AI, pendirian EDPB ialah tiada jangkaan munasabah untuk di-scrape — jadi mengabaikannya melemahkan asas undang-undang yang menjadi sandaran keseluruhan pipeline anda.

Jika klien mengupah saya untuk scrape bagi pihak mereka, siapa yang memikul obligasi GDPR?+

Ia bergantung pada siapa yang menentukan tujuan dan cara. Entiti yang scrape mengikut arahan klien yang didokumenkan — sasaran, kriteria dan tujuan yang ditetapkan klien — berkemungkinan bertindak sebagai pemproses, dan klien memikul obligasi pengawal. Entiti yang memilih sasaran dan tujuannya sendiri ialah pengawal, termasuk apabila ia kemudiannya menjual atau menerbitkan set data itu. Apabila satu pihak menggunakan semula set data yang di-scrape oleh orang lain secara bebas, setiap pihak bertanggungjawab atas pemprosesannya sendiri, melainkan mereka menentukan tujuan dan cara secara bersama, yang mewujudkan pengawalan bersama. Arahan yang didokumenkan itulah yang menjadikan peranan pemproses boleh dipertahankan.

Artikel Berkaitan

Jurang kata kunci web scraping: kajian SERP 2026
Web Scraping

Jurang kata kunci web scraping: kajian SERP 2026

Kami menarik kedudukan organik Google yang sebenar bagi kata kunci yang diperebutkan industri ini. Istilah warisan ialah kubu komersial yang tertutup rapat. Istilah era MCP pula langsung tiada pembela komersial.

C
CrawlForge Team
|
23 Ogo
|
10m
CrawlForge vs Firecrawl vs Tavily vs Exa: API Data Web Terbaik untuk AI Agent (2026)
Web Scraping

CrawlForge vs Firecrawl vs Tavily vs Exa: API Data Web Terbaik untuk AI Agent (2026)

CrawlForge, Firecrawl, Tavily, dan Exa dibandingkan untuk AI agent -- apa yang dilakukan setiap API data web, cara ia mengenakan harga, dan cara memilih yang betul pada 2026.

C
CrawlForge Team
|
16 Jun
|
12m
MCP Server Terbaik untuk Web Scraping pada 2026 (Kedudukan 8 Teratas)
Web Scraping

MCP Server Terbaik untuk Web Scraping pada 2026 (Kedudukan 8 Teratas)

Senarai jujur dan tersusun mengikut kedudukan bagi 8 MCP server terbaik untuk web scraping pada 2026 -- alat, anti-bot, tahap percuma, dan harga dibandingkan sebelah-menyebelah.

C
CrawlForge Team
|
9 Jun
|
11m

Footer

CrawlForge MCP

Web scraping gred perusahaan untuk Ejen AI. 28 alat MCP khusus yang direka untuk pembangun moden yang membina sistem pintar.

Produk

  • Ciri
  • Playground
  • Harga
  • Kes Penggunaan
  • Integrasi
  • Alternatif
  • Changelog

Sumber

  • Mula Bekerja
  • Rujukan API
  • Templat
  • Panduan
  • Blog
  • Glosari
  • Soalan Lazim
  • Peta Laman

Pembangun

  • Protokol MCP
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

Syarikat

  • Tentang
  • Hubungi
  • Privasi
  • Terma
  • Penggunaan Boleh Diterima
  • Cookies

Kekal dikemas kini

Dapatkan kemas kini terkini tentang alat dan ciri baharu.

Dibina dengan Next.js dan protokol MCP

© 2025-2026 CrawlForge. Hak cipta terpelihara.