CrawlForge
Laman UtamaPlaygroundKes PenggunaanIntegrasiHargaDokumentasiBlog
Scraping Mod Senyap: Bagaimana CrawlForge Memintas Pengesanan Anti-Bot
AI Engineering
Kembali ke Blog
Kejuruteraan AI

Scraping Mod Senyap: Bagaimana CrawlForge Memintas Pengesanan Anti-Bot

C
CrawlForge Team
Pasukan Kejuruteraan
22 Januari 2026
14 min bacaan
Dikemas kini 14 April 2026

Pada halaman ini

Laman web moden menggunakan sistem anti-bot yang canggih yang menyekat scraper tradisional. Penelitian teknik mendalam ini menerangkan cara sistem ini berfungsi dan bagaimana mod senyap CrawlForge membantu anda mengakses data secara beretika dan berkesan.

Cabaran: Sistem Anti-Bot Moden

Web scraping telah berkembang menjadi perlumbaan senjata. Laman web menggunakan pelbagai lapisan perlindungan:

Kaedah Pengesanan

  1. Browser Fingerprinting

    • Cap jari canvas
    • Penyaji WebGL
    • Audio context
    • Penghitungan fon
    • Sifat navigator (termasuk pengepala User-Agent)
  2. Analisis Tingkah Laku

    • Pergerakan tetikus
    • Corak skrol
    • Pemasaan klik
    • Input papan kekunci
    • Urutan interaksi halaman
  3. Analisis Permintaan

    • Cap jari TLS (JA3)
    • Tetapan HTTP/2
    • Susunan pengepala
    • Tingkah laku kuki
    • Pemasaan permintaan
  4. Isyarat Rangkaian

    • Reputasi IP
    • Pengesanan pusat data
    • Pengesanan VPN/proxy
    • Konsistensi geografi

Perkhidmatan Anti-Bot Popular

ServiceDetection FocusDifficulty
Cloudflare Bot ManagementCabaran JS, fingerprintingTinggi
Akamai Bot ManagerAnalisis tingkah lakuTinggi
PerimeterXFingerprinting, tingkah lakuTinggi
ImpervaCorak permintaanSederhana
DataDomePengesanan ML masa nyataSangat Tinggi
reCAPTCHAPengesahan manusiaBerubah-ubah

Bagaimana Pengesanan Berfungsi: Gambaran Teknikal

Langkah 1: Permintaan Awal

Apabila scraper anda menghantar permintaan:

Http
GET /page HTTP/1.1
Host: example.com
User-Agent: Mozilla/5.0...
Accept: text/html...

Sistem anti-bot menganalisis:

  • Susunan pengepala (pelayar mempunyai corak yang konsisten)
  • Cap jari handshake TLS
  • Carian pangkalan data reputasi IP
  • Pemasaan permintaan awal

Langkah 2: Cabaran JavaScript

Jika permintaan lulus pemeriksaan awal, halaman memuatkan cabaran JavaScript:

Javascript
// Cloudflare-style challenge
(function() {
  var challenge = document.createElement('script');
  challenge.src = '/cdn-cgi/challenge-platform/...';
  challenge.onload = function() {
    // Run fingerprinting
    var fp = {
      canvas: getCanvasFingerprint(),
      webgl: getWebGLFingerprint(),
      audio: getAudioFingerprint(),
      fonts: getInstalledFonts(),
      // ... 50+ signals
    };

    // Submit for analysis
    sendFingerprint(fp);
  };
  document.head.appendChild(challenge);
})();

Langkah 3: Pemantauan Tingkah Laku

Halaman yang dilindungi sentiasa memantau tingkah laku:

Javascript
document.addEventListener('mousemove', recordMousePosition);
document.addEventListener('scroll', recordScrollBehavior);
document.addEventListener('click', recordClickTiming);

// ML model analyzes for bot-like patterns:
// - Linear mouse movements (bots)
// - Instant scrolling (bots)
// - Perfectly timed clicks (bots)
// - No micro-movements (bots)

Seni Bina Mod Senyap CrawlForge

Alat stealth_mode CrawlForge menangani setiap lapisan pengesanan:

Lapisan 1: Rawakan Cap Jari

Typescript
// Configure stealth with fingerprint settings
{
  "stealthConfig": {
    "level": "advanced",
    "fingerprinting": {
      "canvasNoise": true,        // Add noise to canvas fingerprint
      "webglSpoofing": true,      // Randomize WebGL renderer
      "audioContextSpoofing": true, // Modify audio fingerprint
      "fontSpoofing": true,       // Limit visible fonts
      "hardwareSpoofing": true    // Fake hardware concurrency
    }
  }
}

Cara ia berfungsi:

SignalDetectionStealth Solution
CanvasCap jari peringkat pikselTambah hingar yang tidak ketara
WebGLRentetan penyaji GPUPalsukan kepada penyaji biasa
AudioCap jari AudioContextUbah suai pemprosesan isyarat
FontsHitung fon yang dipasangPulangkan set fon biasa
HardwareTeras CPU, memoriLaporkan nilai biasa

Lapisan 2: Pengelakan Anti-Pengesanan

Typescript
{
  "stealthConfig": {
    "antiDetection": {
      "hideAutomation": true,      // Remove webdriver flags
      "cloudflareBypass": true,    // Handle CF challenges
      "recaptchaHandling": true,   // Solve reCAPTCHA
      "spoofBatteryAPI": true,     // Fake battery info
      "spoofMediaDevices": true    // Fake media devices
    }
  }
}

Pemintasan Pengesanan Webdriver:

Puppeteer/Playwright biasa:

Javascript
navigator.webdriver  // true (DETECTED!)

CrawlForge Stealth:

Javascript
navigator.webdriver  // undefined (passes detection)

Lapisan 3: Simulasi Tingkah Laku Manusia

Typescript
{
  "stealthConfig": {
    "simulateHumanBehavior": true
  }
}

CrawlForge mensimulasikan interaksi manusia yang realistik:

BehaviorBot PatternHuman Simulation
Pergerakan tetikusLinear, segeraMelengkung, kelajuan berbeza
SkrolLompatan segeraLancar, berubah-ubah
KlikTepat, segeraOfset kecil, lengah
MenaipSempurna, segeraKelajuan berbeza, jeda
MembacaTiadaCorak skrol-henti

Lapisan 4: Senyap pada Peringkat Rangkaian

Typescript
{
  "stealthConfig": {
    "proxyRotation": {
      "enabled": true,
      "proxies": ["residential-proxy-pool"],
      "rotationInterval": 300000  // Rotate every 5 min
    },
    "blockWebRTC": true,          // Prevent IP leak
    "randomizeHeaders": true       // Vary header order
  }
}

Menggunakan Mod Senyap dalam Amalan

Scraping Senyap Asas

Typescript
// In Claude Code:
"Enable stealth mode and scrape https://protected-site.com"

// CrawlForge automatically:
// 1. Configures stealth browser context
// 2. Randomizes fingerprint
// 3. Simulates human behavior
// 4. Returns clean data

Konfigurasi Lanjutan

Untuk laman yang dilindungi dengan ketat:

Typescript
// Using the stealth_mode tool directly:
{
  "operation": "create_context",
  "stealthConfig": {
    "level": "advanced",
    "hideWebDriver": true,
    "randomizeFingerprint": true,
    "simulateHumanBehavior": true,
    "fingerprinting": {
      "canvasNoise": true,
      "webglSpoofing": true,
      "audioContextSpoofing": true
    },
    "antiDetection": {
      "cloudflareBypass": true,
      "hideAutomation": true
    },
    "proxyRotation": {
      "enabled": true
    }
  },
  "urlToTest": "https://heavily-protected.com"
}

Menangani Cloudflare

Cloudflare ialah salah satu cabaran yang paling biasa. CrawlForge menanganinya secara automatik:

Typescript
// Standard request to CF-protected site:
"Fetch content from https://cloudflare-protected.com/data"

// CrawlForge automatically:
// 1. Detects Cloudflare challenge
// 2. Enables stealth mode
// 3. Solves JavaScript challenge
// 4. Completes Turnstile if needed
// 5. Returns page content

Bila Hendak Menggunakan Stealth berbanding Alat Asas

Gunakan Alat Asas (fetch_url, extract_text) Apabila:

  • Laman sasaran tiada perlindungan bot
  • Laman membenarkan crawling (semak robots.txt)
  • Anda mengakses API awam
  • Kelajuan lebih penting daripada senyap

Credits: 1-2 per request

Gunakan Mod Senyap Apabila:

  • Laman mempunyai Cloudflare atau perlindungan serupa
  • Permintaan asas disekat atau dikenakan CAPTCHA
  • Anda perlu mengakses kandungan dinamik
  • Laman menyekat IP pusat data secara aktif

Credits: 5 per request

Gunakan scrape_with_actions + Stealth Apabila:

  • Laman memerlukan log masuk atau penyerahan borang
  • Kandungan dimuatkan melalui skrol tak terhingga
  • Anda perlu berinteraksi dengan elemen halaman
  • Navigasi berbilang langkah diperlukan

Credits: 5+ per request

Keputusan Ujian Pengesanan

Kami menguji CrawlForge terhadap perkhidmatan pengesanan popular:

ServiceBasic ModeStealth Mode
CloudflareDisekat✅ Lulus
AkamaiDisekat✅ Lulus
PerimeterXDisekat✅ Lulus
DataDomeDisekat⚠️ Separa
Imperva✅ Lulus✅ Lulus
reCAPTCHA v2Disekat✅ Lulus
reCAPTCHA v3Disekat⚠️ Skor berbeza-beza

Nota: Keputusan mungkin berbeza berdasarkan konfigurasi laman dan reputasi IP.

Pertimbangan Etika

Scraping senyap ialah keupayaan yang berkuasa. Gunakannya dengan bertanggungjawab:

Lakukan:

  • ✅ Hormati robots.txt (walaupun memintas pengesanan)
  • ✅ Hadkan kadar permintaan (jangan membebankan pelayan)
  • ✅ Scrape maklumat awam sahaja
  • ✅ Semak Terma Perkhidmatan
  • ✅ Gunakan untuk tujuan perniagaan yang sah

Jangan:

  • ❌ Scrape data peribadi tanpa kebenaran
  • ❌ Memintas paywall untuk kandungan berhak cipta
  • ❌ Membanjiri laman dengan permintaan
  • ❌ Scrape untuk spam atau tujuan berniat jahat
  • ❌ Mengabaikan permintaan henti-dan-tahan

Rangka Kerja Undang-undang

Kebanyakan bidang kuasa membenarkan scraping data awam untuk:

  • Perbandingan harga
  • Penyelidikan pasaran
  • Penyelidikan akademik
  • Pengagregatan berita

Sentiasa rujuk penasihat undang-undang untuk kes penggunaan khusus anda.

Amalan Terbaik untuk Pengeluaran

1. Tahap Senyap Berperingkat

Mulakan dengan tahap senyap terendah dan tingkatkan hanya jika perlu:

Typescript
async function smartScrape(url: string) {
  // Try basic first (1 credit)
  let result = await fetchUrl(url);
  if (result.success) return result;

  // Try medium stealth (3 credits)
  result = await stealthMode(url, { level: "medium" });
  if (result.success) return result;

  // Try advanced stealth (5 credits)
  return await stealthMode(url, { level: "advanced" });
}

2. Pemasaan Permintaan

Tambah lengah yang realistik antara permintaan:

Typescript
// Bad: Instant sequential requests
for (const url of urls) {
  await scrape(url);  // Blocked after 5-10 requests
}

// Good: Random delays
for (const url of urls) {
  await scrape(url);
  await sleep(2000 + Math.random() * 3000);  // 2-5s delay
}

3. Putaran Sesi

Putarkan konteks pelayar untuk mengelakkan korelasi cap jari:

Typescript
{
  "stealthConfig": {
    "sessionRotation": {
      "enabled": true,
      "rotateAfter": 10,  // New context every 10 requests
      "regenerateFingerprint": true
    }
  }
}

Penyelesaian Masalah

Masih Disekat?

  1. Semak reputasi IP: IP pusat data sering disenaraihitamkan
  2. Dayakan putaran proxy: Gunakan proxy residential
  3. Tingkatkan tahap senyap: Cuba mod "advanced"
  4. Tambah lengah: Tunggu 5-10 saat antara permintaan
  5. Semak CAPTCHA: Sesetengahnya memerlukan penyelesaian manual

Masalah Prestasi?

Mod senyap lebih perlahan daripada scraping asas:

ModeAvg Response Time
Basic (fetch_url)0.5-1s
Stealth (medium)2-3s
Stealth (advanced)4-6s

Optimumkan dengan:

  • Menggunakan batch_scrape untuk berbilang URL
  • Mengcache keputusan secara agresif
  • Menjalankan permintaan secara selari

Related Articles:

  • CrawlForge vs Firecrawl Comparison
  • Building a Competitive Intelligence Agent
  • Complete MCP Web Scraping Guide

Get Started Free - Try stealth mode with 1,000 free credits

Cuba sendiri — tiada pendaftaran diperlukan

Jalankan mana-mana daripada 27 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.

1,000 credits percuma • Isi semula setiap bulan • Tiada kad kredit diperlukan

Tag

stealth-modeanti-bottechnicalweb-scrapingai-scraping-tools

Tentang Penulis

C

CrawlForge Team

Pasukan Kejuruteraan

Membina MCP server web scraping yang paling menyeluruh. Kami mencipta alatan yang membantu pembangun mengekstrak, menganalisis dan mengubah data web untuk aplikasi AI.

Kekal dikemas kini dengan pandangan terkini

Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.

Tiada spam. Berhenti melanggan bila-bila masa.

Praktikkan ini

Uji alat CrawlForge pada mana-mana URL — percuma, tanpa pendaftaran.

Pada halaman ini

Artikel Berkaitan

Alat Web Scraping Terbaik untuk Ejen AI pada 2026
AI Engineering

Alat Web Scraping Terbaik untuk Ejen AI pada 2026

Alat web scraping terbaik untuk ejen AI pada 2026, disusun mengikut kesediaan ejen: penemuan alat MCP-native, skema bertaip, dan output cekap token.

C
CrawlForge Team
|
9 Jun
|
11m
Cara Membina Saluran Paip RAG dengan Data Web
AI Engineering

Cara Membina Saluran Paip RAG dengan Data Web

Bina saluran paip RAG pengeluaran yang crawl laman web, mengekstrak kandungan, chunk teks, menjana embedding, dan menyajikan jawapan terbantu pengambilan.

C
CrawlForge Team
|
14 Apr
|
11m
Ekstrak Data Web Dengan LLM Setempat (Ollama + CrawlForge)
AI Engineering

Ekstrak Data Web Dengan LLM Setempat (Ollama + CrawlForge)

Tiada kunci API, tiada awan, tiada data meninggalkan mesin anda. Gunakan extract_with_llm dengan Ollama setempat untuk menarik data berstruktur daripada mana-mana tapak.

C
CrawlForge Team
|
24 Mei
|
9m

Footer

CrawlForge

Web scraping gred perusahaan untuk Ejen AI. 27 alat MCP khusus yang direka untuk pembangun moden yang membina sistem pintar.

Produk

  • Ciri
  • Playground
  • Harga
  • Kes Penggunaan
  • Integrasi
  • Alternatif
  • Changelog

Sumber

  • Mula Bekerja
  • Rujukan API
  • Templat
  • Panduan
  • Blog
  • Glosari
  • Soalan Lazim
  • Peta Laman

Pembangun

  • Protokol MCP
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

Syarikat

  • Tentang
  • Hubungi
  • Privasi
  • Terma
  • Penggunaan Boleh Diterima
  • Cookies

Kekal dikemas kini

Dapatkan kemas kini terkini tentang alat dan ciri baharu.

Dibina dengan Next.js dan protokol MCP

© 2025-2026 CrawlForge. Hak cipta terpelihara.