Pada halaman ini
Kebanyakan projek web scraping bukanlah keping salji yang unik. Jejak harga pesaing. Kayakan senarai prospek. Audit tapak untuk SEO. Tarik data latihan untuk model. Ia adalah segenggam resipi yang sama, berulang kali. Sebuah templat web scraping ialah salah satu resipi tersebut, sudah berwayar: konfigurasi JSON sedia guna yang merantai alat CrawlForge yang betul dalam susunan yang betul, supaya anda boleh menyalinnya, halakan ke sasaran anda, dan jalankan. CrawlForge menyediakan 24 daripadanya dalam galeri templat. Panduan ini adalah tentang menggunakannya dengan baik -- bukan sekadar salin-tampal, tetapi membaca, menyesuaikan, dan mengira kosnya sebelum anda menskala.
Kandungan
- Apakah itu Templat Web Scraping?
- Galeri Templat vs Alat scrape_template
- Cara Menggunakan Templat dengan Betul
- 8 Templat yang Patut Disalin Dahulu
- 16 Templat yang Lain
- Menyesuaikan atau Membina Sendiri
Apakah itu Templat Web Scraping?
Templat ialah konfigurasi tersimpan yang mengatur dua atau tiga alat CrawlForge menjadi satu aliran kerja dengan hasil perniagaan yang dilampirkan. Daripada mewayarkan search_web kemudian scrape_structured kemudian analyze_content sendiri -- dan meneka setiap parameter -- anda menyalin konfigurasi yang sudah melakukannya.
Setiap templat dalam galeri membawa:
- Sebuah kategori -- E-commerce, Research, Data Collection, Monitoring, AI & LLM, Sales, SEO, Content, atau Advanced Scraping (sembilan kesemuanya).
- Sebuah tahap kesukaran -- beginner, intermediate, atau advanced.
- Rantai alat yang dijalankannya dan kos credit tetap setiap larian (3 hingga 19 credits).
- Sebuah konfigurasi JSON salin-tampal dengan parameter lalai yang munasabah.
Anda menjalankan konfigurasi itu daripada mana-mana klien MCP (Claude, Cursor, Windsurf), CLI crawlforge, atau REST API. Konfigurasi sama, bentuk keputusan sama.
Galeri Templat vs Alat scrape_template
Ini mengelirukan orang, jadi mari kita jelas. CrawlForge mempunyai dua perkara berbeza dengan "template" dalam namanya:
| Galeri templat | Alat scrape_template | |
|---|---|---|
| Apa itu | Pustaka rantai konfigurasi berbilang alat | Satu alat dengan 10 skema tapak |
| Skop | Mana-mana aliran kerja (harga, SEO, penyelidikan...) | 10 tapak khusus (Amazon, LinkedIn, GitHub...) |
| Output | Apa sahaja yang dipulangkan oleh alat berantai | JSON berstruktur untuk satu tapak itu |
| Kos | 3-19 credits/larian (jumlah alatnya) | 1 credit/panggilan |
| Guna apabila | Anda mahukan keseluruhan aliran kerja, siap sedia | Anda mahukan data daripada satu tapak popular |
Jika sasaran anda ialah salah satu daripada sepuluh tapak yang disokong, gunakan alat itu -- ia diliputi secara mendalam dalam Scrape Amazon, LinkedIn & 8 Tapak Lain Dengan Satu Alat. Untuk segala-galanya yang lain -- pipeline pemantauan harga atau pengayaan prospek penuh -- anda mahukan templat galeri. Panduan ini adalah tentang galeri.
Cara Menggunakan Templat dengan Betul
Salin-tampal ialah langkah satu. Menggunakan templat dengan baik ialah enam langkah.
1. Pilih mengikut hasil, bukan mengikut alat. Mulakan daripada tugas ("pantau harga pesaing") dan tapis galeri mengikut kategori dan tahap kesukaran. Baru dalam ini? Mulakan dengan templat beginner dua alat yang murah sebelum menggapai pipeline penyelidikan 19 credit.
2. Baca konfigurasi sebelum anda jalankan. Lihat susunan alat, parameter, dan sama ada ia membawa schedule (hourly, daily, atau weekly). Susunan penting: search_web mencari URL, kemudian scrape_structured mengekstrak daripadanya.
3. Tukar tempat letak. Setiap konfigurasi disertakan dengan nilai contoh -- https://competitor-a.com/pricing, {company_name}, "product name", skema lalai. Gantikannya dengan sasaran sebenar anda dan medan tepat yang anda mahu kembali. Skema ialah kontrak output anda; pangkasnya kepada apa yang anda akan benar-benar gunakan.
4. Buat pengiraan credit sebelum anda menskala. Kos templat hanyalah jumlah kos alat-alatnya. Darab dengan kekerapan: larian templat 7 credit setiap jam ialah 168 credits/hari. Berikut ialah jadual setiap alat yang dirujuk oleh konfigurasi:
| Credits | Alat |
|---|---|
| 1 | fetch_url, extract_text, extract_links, extract_metadata, scrape_template |
| 2 | scrape_structured, extract_content, map_site, process_document, localization |
| 3 | analyze_content, track_changes, extract_structured, extract_with_llm |
| 4 | summarize_content, crawl_deep |
| 5 | stealth_mode, scrape_with_actions, batch_scrape, search_web, generate_llms_txt |
| 10 | deep_research |
5. Jalankan ia daripada timbunan pilihan anda. Dalam klien MCP, tampal matlamat dan biarkan ejen memanggil alat. Daripada terminal atau kerja cron, gunakan CLI crawlforge. Dalam aplikasi, panggil REST API. Ketiga-tiganya berkongsi satu API key dan satu baki credit.
6. Jadualkan dan pantau. Templat yang dibina untuk pemantauan membawa schedule. Gandingkannya dengan track_changes supaya anda bertindak pada perbezaan, bukan pada setiap larian yang sama.
8 Templat yang Patut Disalin Dahulu
Galeri mempunyai 24. Lapan ini meliputi tugas paling tinggi permintaan dan merentang daripada beginner hingga advanced.
1. Competitor Pricing Monitor
E-commerce · intermediate · 7 credits/larian · batch_scrape + scrape_structured
Scrape satu set halaman harga pesaing mengikut jadual dan normalkannya menjadi struktur plan / harga / ciri yang bersih.
{
"tools": [
{
"name": "batch_scrape",
"params": {
"urls": [
"https://competitor-a.com/pricing",
"https://competitor-b.com/pricing"
],
"selectors": { "price": ".price", "name": "h1" }
}
},
{
"name": "scrape_structured",
"params": {
"schema": {
"plans": [{ "name": "string", "price": "string", "features": ["string"] }]
}
}
}
],
"schedule": "daily"
}Sesuaikan ia: gantikan urls dengan halaman harga pesaing anda, kemudian tala selectors dan schema kepada medan yang anda jejak. Kekalkan schedule pada daily untuk kebanyakan kerja harga. Panduan penuh: bina sistem pemantauan harga AI.
2. Contact Enrichment Pipeline
Sales · intermediate · 7 credits/larian · search_web + extract_metadata + extract_links
Tukar nama syarikat semata-mata menjadi rekod yang diperkaya -- tapak rasmi, pemegang sosial, dan pautan utama.
{
"tools": [
{
"name": "search_web",
"params": { "query": "{company_name} official website" }
},
{
"name": "extract_metadata",
"params": { "include": ["og:title", "og:description", "twitter:site"] }
},
{
"name": "extract_links",
"params": { "filter": ["linkedin.com", "twitter.com", "github.com"] }
}
]
}Sesuaikan ia: pacu {company_name} daripada eksport CRM anda, dan luaskan penapis extract_links kepada domain yang anda pentingkan. Jalankan ia per baris untuk memperkayakan keseluruhan senarai. Panduan penuh: bina enjin pengayaan prospek.
3. SEO Site Audit
SEO · beginner · 6 credits/larian · map_site + extract_metadata + analyze_content
Crawl satu tapak, tarik metadata setiap halaman, dan beri skor kualiti kandungan -- audit yang pantas dan boleh diulang.
{
"tools": [
{
"name": "map_site",
"params": { "url": "https://your-site.com", "max_depth": 3 }
},
{
"name": "extract_metadata",
"params": {}
},
{
"name": "analyze_content",
"params": { "metrics": ["readability", "topics", "sentiment"] }
}
]
}Sesuaikan ia: halakan url ke domain anda dan naikkan atau turunkan max_depth untuk mengawal keluasan crawl (dan kos). Salah satu templat termurah untuk dijalankan secara berkala. Panduan penuh: mengautomasikan audit SEO dengan CrawlForge.
4. AI Training Data Collector
AI & LLM · intermediate · 7 credits/larian · batch_scrape + extract_content
Kumpul dan bersihkan halaman web secara berskala menjadi teks sedia model -- tiada navigasi, tiada boilerplate.
{
"tools": [
{
"name": "batch_scrape",
"params": {
"urls": ["https://docs.example.com/page-1", "https://docs.example.com/page-2"],
"format": "markdown"
}
},
{
"name": "extract_content",
"params": { "format": "text", "remove_navigation": true }
}
]
}Sesuaikan ia: suap urls daripada sitemap atau CSV, dan kekalkan remove_navigation hidup supaya menu dan pengaki tidak mencemari set data anda. Panduan penuh: web scraping untuk pipeline data latihan AI.
5. Market Intelligence Dashboard
Research · advanced · 19 credits/larian · deep_research + batch_scrape + summarize_content
Yang utama. Jalankan penyelidikan berbilang sumber, scrape sumber industri utama, dan ringkaskan kesemuanya menjadi taklimat harian.
{
"tools": [
{
"name": "deep_research",
"params": {
"query": "SaaS market trends and funding rounds",
"sources": 10,
"conflict_detection": true
}
},
{
"name": "batch_scrape",
"params": {
"urls": ["https://techcrunch.com", "https://www.saastr.com"],
"format": "markdown"
}
},
{
"name": "summarize_content",
"params": { "max_length": 300, "format": "bullet_points" }
}
],
"schedule": "daily"
}Sesuaikan ia: tukar query kepada pasaran anda dan tukar urls kepada sumber dipercayai anda. Pada 19 credits/larian ia adalah templat paling mahal di sini -- jalankan ia daily, bukan setiap jam. Bacaan berkaitan: perisikan persaingan dengan ejen AI.
6. Review Sentiment Analyzer
E-commerce · intermediate · 10 credits/larian · search_web + scrape_structured + analyze_content
Cari ulasan merentas platform, strukturkannya, dan beri skor sentimen dan topik.
{
"tools": [
{
"name": "search_web",
"params": { "query": "\"product name\" reviews", "max_results": 10 }
},
{
"name": "scrape_structured",
"params": {
"schema": {
"reviewer": "string",
"rating": "number",
"text": "string",
"date": "string"
}
}
},
{
"name": "analyze_content",
"params": { "metrics": ["sentiment", "topics"] }
}
]
}Sesuaikan ia: letak produk anda dalam query, naikkan max_results untuk liputan lebih luas, dan kekalkan skema ketat supaya pemberian skor sentimen kekal bersih. Bacaan berkaitan: pengekstrakan data produk e-dagang secara berskala.
7. Job Listings Scraper
Data Collection · intermediate · 7 credits/larian · search_web + scrape_structured
Cari papan kerja dan tarik penyenaraian menjadi suapan berstruktur -- jawatan, syarikat, lokasi, gaji, tarikh.
{
"tools": [
{
"name": "search_web",
"params": { "query": "software engineer remote jobs 2026", "max_results": 20 }
},
{
"name": "scrape_structured",
"params": {
"schema": {
"title": "string",
"company": "string",
"location": "string",
"salary": "string",
"posted_date": "string"
}
}
}
]
}Sesuaikan ia: tukar query kepada jawatan dan wilayah anda, dan tambah medan skema (bendera jarak jauh, kekananan) mengikut keperluan. Lihatnya secara langsung pada halaman templat Job Listings Scraper.
8. Website Change Detector
Monitoring · beginner · 6 credits/larian · fetch_url + extract_content + analyze_content
Perhatikan satu halaman dan dedahkan apabila kandungannya beralih -- harga, terma, atau pengumuman.
{
"tools": [
{
"name": "fetch_url",
"params": { "url": "https://example.com/page-to-monitor" }
},
{
"name": "extract_content",
"params": { "format": "text" }
},
{
"name": "analyze_content",
"params": { "metrics": ["topics"] }
}
],
"schedule": "hourly"
}Sesuaikan ia: tetapkan url kepada halaman yang anda pentingkan dan dailkan schedule kepada toleransi anda terhadap data lapuk -- hourly untuk halaman yang bergerak pantas, daily untuk selebihnya. Bacaan berkaitan: bina ejen perisikan persaingan.
16 Templat yang Lain
Entri galeri yang selebihnya, dikumpulkan mengikut kategori -- setiap satu ialah konfigurasi salin-tampal di halaman templat:
- Research: News Aggregation Pipeline (11cr), Multi-Source Research Agent (12cr), Academic Paper Research (14cr).
- Data Collection: Real Estate Listings Tracker (7cr), PDF Document Processor (6cr), Government Data Extractor (5cr).
- Monitoring: Compliance Monitoring (9cr), Social Media Monitoring (12cr).
- E-commerce: E-commerce Product Extraction (3cr).
- AI & LLM: Documentation Knowledge Base (10cr).
- Sales: Tech Stack Detector (3cr).
- SEO: Link Building Prospector (7cr).
- Content: Content Migration Tool (7cr), Localization Content Audit (7cr).
- Advanced Scraping: Dynamic SPA Scraper (7cr), Stealth Data Extraction (7cr).
Menyesuaikan atau Membina Sendiri
Tiada templat yang sempurna padan di luar kotak -- itulah tujuan langkah tiga. Apabila konfigurasi membawa anda 80% ke sana, tukar parameter dan skema dan anda selesai. Apabila tiada yang padan:
- Mulakan daripada templat terdekat dan tulis semula skema dan parameternya.
- Gubah alat sendiri. Gunakan
scrape_structuredapabila anda tahu pemilih CSS yang stabil, atauextract_with_llmapabila susun atur beralih dan anda mahukan pengekstrakan dipacu skema yang berdaya tahan susun atur. - Minta sebuah templat. Jika anda mahukan resipi yang kami belum sediakan, tanya di Discord -- permintaan popular ditambah ke galeri.
Bersedia untuk menjalankan templat pertama anda? Mula percuma dengan 1,000 credits -- tiada kad kredit diperlukan. Layari galeri templat penuh, ambil alat scrape_template untuk kerja tapak tunggal, atau saksikan templat berjalan dalam pengeluaran dalam panduan pengekstrakan e-dagang.
Cuba sendiri — tiada pendaftaran diperlukan
Jalankan mana-mana daripada 27 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.
1,000 credits percuma • Isi semula setiap bulan • Tiada kad kredit diperlukan
Tag
Tentang Penulis
Kekal dikemas kini dengan pandangan terkini
Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.
Tiada spam. Berhenti melanggan bila-bila masa.