Pada halaman ini
Dify ialah platform pembangunan aplikasi LLM sumber terbuka yang membolehkan anda membina aplikasi AI dengan editor aliran kerja visual. Dengan menambah CrawlForge sebagai alat tersuai, aliran kerja Dify anda memperoleh keupayaan untuk scrape tapak web, mencari web, dan mengekstrak data berstruktur -- semuanya tanpa menulis kod.
Panduan ini merangkumi kedua-dua pendekatan tanpa kod (konfigurasi alat visual Dify) dan pendekatan berasaskan API untuk integrasi lanjutan.
Jadual Kandungan
- Apakah itu Dify?
- Prasyarat
- Langkah 1: Sediakan Penyedia Alat Tersuai
- Langkah 2: Takrifkan Skema Alat CrawlForge
- Langkah 3: Bina Aliran Kerja Penyelidikan Web
- Langkah 4: Bina Saluran Paip Pengekstrakan Kandungan
- Langkah 5: Kendalikan Pengesahan dan Ralat
- Rujukan Kos Credit
- Alat CrawlForge yang Tersedia dalam Dify
- Langkah Seterusnya
Apakah itu Dify?
Dify ialah platform sedia pengeluaran untuk membina aplikasi LLM. Ia menyediakan pembina aliran kerja visual, orkestrasi ejen, pengurusan saluran paip RAG, dan pustaka 50+ alat terbina dalam. Dify menyokong integrasi alat tersuai melalui spesifikasi OpenAPI, yang bermaksud mana-mana REST API -- termasuk CrawlForge -- boleh ditambah sebagai alat.
Integrasi MCP asli Dify juga bermaksud anda boleh menyambungkan CrawlForge sebagai MCP server secara terus. Panduan ini merangkumi kedua-dua pendekatan.
Prasyarat
- Instans Dify -- sama ada Dify Cloud atau dihos sendiri melalui Docker
- Satu akaun CrawlForge dengan API key (1,000 credits percuma)
- Akses pentadbir ke ruang kerja Dify anda
Langkah 1: Sediakan Penyedia Alat Tersuai
Dalam papan pemuka Dify anda, navigasi ke Tools > Custom Tools > Create Custom Tool.
Tampal spesifikasi OpenAPI berikut untuk mendaftarkan alat teras CrawlForge:
openapi: "3.0.0"
info:
title: CrawlForge Web Scraping Tools
version: "1.0.0"
description: "26 specialized web scraping tools for AI applications"
servers:
- url: https://crawlforge.dev/api/v1/tools
paths:
/extract_content:
post:
operationId: extractContent
summary: Extract clean content from a URL (2 credits)
requestBody:
required: true
content:
application/json:
schema:
type: object
required: [url]
properties:
url:
type: string
description: The URL to extract content from
responses:
"200":
description: Extracted content
/search_web:
post:
operationId: searchWeb
summary: Search the web via Google (5 credits)
requestBody:
required: true
content:
application/json:
schema:
type: object
required: [query]
properties:
query:
type: string
description: Search query
limit:
type: integer
description: Max results (default 10)
responses:
"200":
description: Search results
/fetch_url:
post:
operationId: fetchUrl
summary: Fetch raw page content (1 credit)
requestBody:
required: true
content:
application/json:
schema:
type: object
required: [url]
properties:
url:
type: string
description: The URL to fetch
responses:
"200":
description: Raw page content
/scrape_structured:
post:
operationId: scrapeStructured
summary: Extract data with CSS selectors (2 credits)
requestBody:
required: true
content:
application/json:
schema:
type: object
required: [url, selectors]
properties:
url:
type: string
selectors:
type: object
additionalProperties:
type: string
responses:
"200":
description: Structured extraction resultsTetapkan pengesahan kepada Bearer Token dan masukkan API key CrawlForge anda (cf_live_...).
Langkah 2: Takrifkan Skema Alat CrawlForge
Selepas mengimport spec OpenAPI, Dify secara automatik menjana kad alat untuk setiap titik akhir. Konfigurasikan setiap alat dengan nama deskriptif supaya ejen LLM boleh memilihnya dengan betul:
| Nama Alat Dify | Titik Akhir CrawlForge | Credits | Bila Ejen Patut Menggunakannya |
|---|---|---|---|
| Fetch Web Page | /fetch_url | 1 | Pengguna menyediakan URL khusus untuk dibaca |
| Extract Content | /extract_content | 2 | Memerlukan teks yang bersih dan boleh dibaca daripada halaman |
| Search the Web | /search_web | 5 | Memerlukan untuk mencari halaman tentang sesuatu topik |
| Extract Structured Data | /scrape_structured | 2 | Memerlukan titik data khusus melalui pemilih CSS |
Untuk setiap alat dalam Dify, tambah perihalan yang jelas yang menyertakan kos credit. Ini membantu ejen LLM membuat keputusan yang cekap kos.
Langkah 3: Bina Aliran Kerja Penyelidikan Web
Dalam editor aliran kerja Dify, cipta aliran kerja baharu dengan nod ini:
// Pseudocode for the Dify workflow (implemented visually in Dify's editor)
// Node 1: Start -- User provides a research topic
// Input: { topic: string }
// Node 2: Search Web (5 credits)
// Tool: CrawlForge search_web
// Input: { query: "{{topic}} latest developments 2026", limit: 5 }
// Output: search_results
// Node 3: Extract Top Results (2 credits each)
// Tool: CrawlForge extract_content
// Loop over: search_results.results[0..2]
// Input: { url: "{{item.link}}" }
// Output: extracted_pages[]
// Node 4: LLM Synthesis
// Model: Claude Sonnet
// Prompt: "Synthesize these sources into a research brief: {{extracted_pages}}"
// Output: research_summary
// Node 5: End -- Return research_summary to user
// Total credits: 5 + (3 * 2) = 11 credits per runAliran kerja visual dalam Dify menjadikan ini operasi seret-dan-lepas. Setiap nod bersambung kepada yang seterusnya, dengan data mengalir melalui pemboleh ubah templat.
Langkah 4: Bina Saluran Paip Pengekstrakan Kandungan
Untuk tugas pengekstrakan data berulang, bina aliran kerja saluran paip:
// Dify workflow for daily competitor monitoring
// Node 1: Start (triggered by schedule or API call)
// Input: { urls: ["https://competitor1.com/pricing", "https://competitor2.com/pricing"] }
// Node 2: Batch Extract (2 credits per URL)
// Tool: CrawlForge scrape_structured
// Loop over: urls
// Input: {
// url: "{{item}}",
// selectors: {
// plans: ".pricing-plan h3",
// prices: ".pricing-plan .price",
// features: ".pricing-plan .feature-list"
// }
// }
// Output: pricing_data[]
// Node 3: LLM Analysis
// Model: Claude Haiku (for cost efficiency)
// Prompt: "Compare these pricing pages and highlight any changes: {{pricing_data}}"
// Output: analysis
// Node 4: Conditional -- if changes detected, send notification
// Node 5: End
// Total: 2 * number_of_urls credits per runLangkah 5: Kendalikan Pengesahan dan Ralat
Pengesahan
CrawlForge menggunakan pengesahan token Bearer. Dalam Dify, tetapkan ini sekali pada peringkat penyedia alat tersuai:
- Pergi ke Tools > Custom Tools > CrawlForge
- Klik Configure Authorization
- Pilih API Key (Bearer)
- Masukkan API key CrawlForge anda
Semua panggilan alat dalam aliran kerja secara automatik menyertakan pengepala pengesahan.
Pengendalian Ralat
Tambah nod pengendalian ralat dalam aliran kerja Dify anda untuk senario biasa:
// Error handling pattern for Dify workflows
// After each CrawlForge tool node, add a conditional:
// If response.status === 402 -> "Insufficient credits"
// -> Notify user to top up at crawlforge.dev/pricing
// If response.status === 429 -> "Rate limited"
// -> Wait 2 seconds, retry the node
// If response.status === 500 -> "Server error"
// -> Log error, skip this URL, continue workflowMekanisme percubaan semula terbina dalam Dify mengendalikan kegagalan sementara secara automatik. Untuk ralat kehabisan credit (HTTP 402), halakan ke nod pemberitahuan yang memaklumkan pengguna.
Rujukan Kos Credit
| Credits | Alat | Kes Penggunaan Aliran Kerja Dify |
|---|---|---|
| 1 | fetch_url, extract_text, extract_links, extract_metadata | Pencetus fetch halaman ringkas |
| 2 | scrape_structured, extract_content, map_site, process_document, localization | Nod saluran paip pengekstrakan, aliran kerja audit tapak |
| 3 | track_changes, analyze_content | Pengesanan perubahan, analisis kandungan |
| 4 | summarize_content, crawl_deep | Penjanaan ringkasan, perangkakan berbilang halaman |
| 5 | search_web, batch_scrape, scrape_with_actions, stealth_mode | Aliran kerja penyelidikan dan pukal |
| 10 | deep_research | Aliran kerja analisis menyeluruh |
Alat CrawlForge yang Tersedia dalam Dify
Kesemua 26 alat CrawlForge boleh didaftarkan dalam Dify. Yang paling kerap digunakan dalam aliran kerja visual ialah:
| Alat | Credits | Mengapa Ia Berfungsi dengan Baik dalam Dify |
|---|---|---|
| search_web | 5 | Titik permulaan semula jadi untuk aliran kerja penyelidikan |
| extract_content | 2 | Output bersih menyuap terus ke dalam nod LLM |
| scrape_structured | 2 | Pemilih CSS mengembalikan JSON yang boleh diramal dan berstruktur |
| fetch_url | 1 | Pilihan termurah untuk akses halaman ringkas |
| batch_scrape | 5 | Mengendalikan gelung dengan lebih cekap daripada panggilan individu |
Langkah Seterusnya
- Dokumentasi Dify -- dokumen platform Dify rasmi
- Rujukan API CrawlForge -- skema titik akhir untuk kesemua 26 alat
- Panduan MCP Lengkap -- memahami integrasi protokol MCP
- Harga CrawlForge -- pek credit bermula pada $19/bulan
Tambah web scraping ke aplikasi Dify anda hari ini. Dapatkan API key percuma anda dengan 1,000 credits dan daftarkan CrawlForge sebagai alat tersuai dalam Dify. Tiada kod diperlukan.
Cuba sendiri — tiada pendaftaran diperlukan
Jalankan mana-mana daripada 27 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.
1,000 credits percuma • Isi semula setiap bulan • Tiada kad kredit diperlukan
Tag
Tentang Penulis
Kekal dikemas kini dengan pandangan terkini
Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.
Tiada spam. Berhenti melanggan bila-bila masa.