Pada halaman ini
Kebanyakan alat AI gemar menjadi ejen. CrawlForge CLI dibina untuk yang sebaliknya: boleh diskrip, mengutamakan-terminal, boleh diramal. Anda memasangnya, menetapkan pemboleh ubah persekitaran, dan setiap satu daripada 26 tools CrawlForge menjadi arahan shell. JSON masuk, JSON keluar. Salurkan ke jq, jadualkan dengan cron, jalankan dalam CI -- ia berfungsi dengan cara yang sama di mana-mana.
Jadual Kandungan
- Apakah Itu CrawlForge CLI?
- Pasang dalam 30 Saat
- 15 Arahan Sepintas Lalu
- Scrape Pertama Anda
- Menyalurkan Output JSON ke jq
- Menjadualkan Dengan Cron
- CLI vs MCP vs Raw API
- Tiga Aliran Kerja Dunia Sebenar
- Rujukan Bendera Global
- Apa Kosnya
Apakah Itu CrawlForge CLI?
CrawlForge CLI dihantar di dalam pakej crawlforge-mcp-server sebagai arahan crawlforge dan mendedahkan kesemua 26 tools CrawlForge sebagai arahan terminal. Satu pemasangan global memberi anda kedua-dua MCP server dan CLI. Ia tidak memerlukan proses yang berjalan lama atau klien MCP: anda menaip crawlforge scrape <url>, ia membuat panggilan HTTPS ke API CrawlForge, dan mencetak JSON ke stdout. Itu sahaja keseluruhan ceritanya.
Ia wujud kerana separuh daripada kerja scraping yang dilakukan orang bukan berbentuk-ejen. Kerja cron, langkah CI, penyelidikan sekali sahaja, tarikan ad-hoc daripada shell -- itu memerlukan arahan biasa, bukan jabat tangan JSON-RPC.
Pasang dalam 30 Saat
npm install -g crawlforge-mcp-server
export CRAWLFORGE_API_KEY="cf_live_your_key_here"
crawlforge --helpItu sahaja. Tiada fail konfigurasi, tiada aliran auth, tiada perkhidmatan untuk dimulakan. Jika anda belum mempunyai API key, dapatkan satu di crawlforge.dev/signup -- anda mendapat 1,000 credits percuma semasa pendaftaran.
Untuk menjadikan pemboleh ubah persekitaran kekal pada macOS atau Linux:
echo 'export CRAWLFORGE_API_KEY="cf_live_..."' >> ~/.zshrc
source ~/.zshrcPada Windows (PowerShell):
[Environment]::SetEnvironmentVariable("CRAWLFORGE_API_KEY", "cf_live_...", "User")15 Arahan Sepintas Lalu
Setiap arahan dipetakan ke satu atau lebih tools CrawlForge:
| Arahan | Tool utama | Credits | Contoh |
|---|---|---|---|
scrape | fetch_url, extract_content | 1-2 | crawlforge scrape https://example.com |
search | search_web | 5 | crawlforge search "MCP servers 2026" |
crawl | crawl_deep | 4 | crawlforge crawl https://docs.example.com --depth 3 |
map | map_site | 2 | crawlforge map https://example.com |
extract | extract_with_llm | 3 | crawlforge extract <url> --schema schema.json |
track | track_changes | 3 | crawlforge track <url> --threshold 10 |
analyze | analyze_content | 3 | crawlforge analyze <url> |
research | deep_research | 10 | crawlforge research "AI agents in 2026" |
stealth | stealth_mode | 5 | crawlforge stealth <url> |
batch | batch_scrape | 5 | crawlforge batch urls.txt |
actions | scrape_with_actions | 5 | crawlforge actions <url> --script steps.json |
localize | localization | 2 | crawlforge localize <url> --country DE |
llmstxt | generate_llms_txt | 5 | crawlforge llmstxt https://example.com |
template | scrape_template | 1 | crawlforge template amazon-product <url> |
monitor | track_changes | 3 | crawlforge monitor <url> --interval 3600 |
Scrape Pertama Anda
Panggilan paling mudah yang mungkin:
crawlforge scrape https://news.ycombinator.comApa yang dipulangkan ialah kandungan utama halaman sebagai JSON:
{
"url": "https://news.ycombinator.com",
"title": "Hacker News",
"content": "Hacker News new | past | comments | ask...",
"links": ["https://news.ycombinator.com/from?site=...", "..."],
"fetched_at": "2026-05-21T10:14:33Z",
"credits_used": 1
}Mahukan URL sahaja? Salurkan ke jq:
crawlforge scrape https://news.ycombinator.com --json | jq '.links[]'Mahukannya dalam fail? Ubah hala stdout:
crawlforge scrape https://news.ycombinator.com --pretty > hn.jsonMenyalurkan Output JSON ke jq
Inilah aliran kerja yang menjadikan CLI berbaloi dipasang. Semuanya mengeluarkan JSON, dan JSON disalurkan ke apa sahaja.
Dapatkan tajuk cerita halaman hadapan HN:
crawlforge template hacker-news-front-page https://news.ycombinator.com --json \
| jq -r '.stories[] | .title'Cari di web dan ekstrak URL:
crawlforge search "best web scraping libraries 2026" --json \
| jq '.results[] | .url'Scrape halaman dan kira perkataan:
crawlforge scrape https://example.com --json \
| jq -r '.content' \
| wc -wBatch scrape, kemudian tapis untuk respons ralat:
crawlforge batch urls.txt --json \
| jq '.results[] | select(.status_code >= 400)'Coraknya: --json memberi anda output yang boleh dibaca mesin, kemudian jq menghiris dan memotongnya.
Menjadualkan Dengan Cron
Semakan harian pada halaman harga pesaing:
# crontab -e
0 9 * * * /usr/local/bin/crawlforge track https://competitor.com/pricing --json > /var/log/pricing.jsonLarian penyelidikan setiap malam:
0 2 * * * /usr/local/bin/crawlforge research "AI tooling news" --depth standard --pretty > /var/log/research.jsonPenjanaan semula llms.txt mingguan untuk laman anda sendiri:
0 3 * * 0 /usr/local/bin/crawlforge llmstxt https://yoursite.com --include-full > /var/www/yoursite.com/llms.txtDalam CI? Gunakan arahan yang sama dalam YAML GitHub Actions anda. CLI menyemak CRAWLFORGE_API_KEY dahulu, jadi cuma tetapkannya sebagai rahsia repositori.
# .github/workflows/daily-research.yml
- name: Run weekly research
env:
CRAWLFORGE_API_KEY: ${{ secrets.CRAWLFORGE_API_KEY }}
run: |
npm install -g crawlforge-mcp-server
crawlforge research "industry news" --depth standard --pretty > report.jsonCLI vs MCP vs Raw API: Bila Hendak Menggunakan Setiap Satu
| Aliran kerja | Guna CLI | Guna MCP | Guna Raw API |
|---|---|---|---|
| Scrape sekali sahaja daripada terminal anda | ya | tidak | tidak |
| Kerja cron atau langkah CI | ya | tidak | hanya jika perlu |
| Ejen Claude / Cursor / Windsurf | tidak | ya | tidak |
| Tertanam dalam perkhidmatan Node/Python | tidak | hanya jika berbentuk-MCP | ya |
| Pekerja latar belakang yang berjalan lama | tidak | tidak | ya |
| Penerokaan pantas laman yang tidak biasa | ya | mungkin | tidak |
Petua umum: jika manusia menaip arahan, gunakan CLI. Jika LLM memilih tool, gunakan MCP. Jika server memanggilnya dalam gelung, gunakan raw API.
Tiga Aliran Kerja Dunia Sebenar
1. Pemantau Harga Kompetitif
Skrip shell yang berjalan setiap hari, melakukan scraping pada tiga halaman harga pesaing, membandingkan dengan petikan semalam, dan menyiarkan ke Slack jika ada apa-apa yang berubah.
#!/bin/bash
for url in $(cat competitors.txt); do
crawlforge track "$url" --json \
> "snapshots/$(date +%F)-$(basename $url).json"
done
# Diff against yesterday's snapshot
diff "snapshots/$(date -v-1d +%F)-pricing.json" \
"snapshots/$(date +%F)-pricing.json" \
|| curl -X POST $SLACK_WEBHOOK -d '{"text": "Pricing changed"}'Kos: ~9 credits sehari (3 pesaing × 3 credits untuk track).
2. Pengayaan Petunjuk Daripada CSV
Baca CSV domain syarikat, lakukan scraping pada setiap halaman utama untuk maklumat hubungan, tulis semula data yang diperkaya.
while IFS=, read -r company domain; do
data=$(crawlforge scrape "https://$domain" --json)
email=$(echo "$data" | jq -r '.metadata.contact_email // empty')
echo "$company,$domain,$email" >> enriched.csv
done < companies.csvKos: 1 credit setiap syarikat.
3. Saluran Paip Laporan Penyelidikan
Cron Ahad mingguan yang menjalankan pertanyaan research dan menghantar e-mel ringkasan yang disintesis kepada pasukan.
crawlforge research "AI agent frameworks news this week" --depth deep --pretty > report.json
jq -r '.summary' report.json \
| mail -s "Weekly AI report" team@example.comKos: 10 credits setiap larian (research termasuk ringkasan yang disintesis).
Rujukan Bendera Global
Ini berfungsi pada setiap arahan:
--json-- JSON padat yang boleh dibaca mesin (mesra-penyaluran)--pretty-- JSON yang dicetak kemas--quiet-- nyahkan semua output stdout (kod keluar sahaja)--api-key <key>-- atasi pemboleh ubah persekitaranCRAWLFORGE_API_KEY--timeout <ms>-- atasi tamat masa lalai 30s
Untuk menulis hasil ke fail, ubah hala stdout: crawlforge scrape <url> --pretty > out.json.
Apa Kosnya
CLI itu sendiri adalah percuma. Anda hanya membayar untuk panggilan tool yang mendasarinya, dikenakan terhadap baki credit sedia ada anda. Tiada langganan tambahan, tiada yuran setiap permulaan. Cron harian yang menjalankan track terhadap tiga URL dan research sekali seminggu kira-kira berharga 100 credits sebulan -- masih dalam free tier.
Bersedia untuk memasang? Dapatkan API key percuma anda di crawlforge.dev/signup dan jalankan npm install -g crawlforge-mcp-server. Baru di sini? Baca pengumuman pelancaran v4.2.2 untuk semua yang baharu, atau mula pantas MCP asal untuk versi MCP sebaliknya.
Cuba sendiri — tiada pendaftaran diperlukan
Jalankan mana-mana daripada 27 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.
1,000 credits percuma • Isi semula setiap bulan • Tiada kad kredit diperlukan
Tag
Tentang Penulis
Kekal dikemas kini dengan pandangan terkini
Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.
Tiada spam. Berhenti melanggan bila-bila masa.