Pada halaman ini
Hari ini kami menghadirkan CrawlForge v4.2.2, keluaran terbesar kami sejak pelancaran. Ia membawa tiga alat baharu, antara muka baris arahan tersendiri, dan satu peralihan senyap dalam cara kami memikirkan web scraping untuk AI: kebanyakannya sepatutnya berjalan secara tempatan, pada mesin anda sendiri, tanpa API keys.
Pos ini ialah payung untuk segala-galanya dalam 4.2.2. Tiga panduan mendalam menyusul dalam sembilan hari akan datang.
Jadual Kandungan
- Apa yang Dihadirkan
- CLI CrawlForge Baharu
- Extract With LLM: Pengekstrakan AI Tempatan
- Scrape Template: Sepuluh Tapak, Satu Panggilan
- list_ollama_models: Penemuan Model
- Aliran Kerja Lama vs Aliran Kerja v4.2.2
- Kos Credit
- Cara Menaik Taraf
- Apa yang Seterusnya
Apa yang Dihadirkan
v4.2.2 menambah empat perkara:
- CLI crawlforge -- alat baris arahan tersendiri, dihadirkan dalam pakej
crawlforge-mcp-server, yang mendedahkan kesemua 26 alat CrawlForge kepada shell anda. Tiada klien MCP diperlukan. - extract_with_llm -- pengekstrakan berstruktur berkuasa LLM yang lalainya menggunakan Ollama tempatan. Tiada API key luaran diperlukan.
- scrape_template -- scraper pra-bina untuk Amazon, LinkedIn, GitHub, YouTube, Reddit, Hacker News, Stack Overflow, npm, Product Hunt, dan Twitter/X.
- list_ollama_models -- alat penemuan yang menyenaraikan model pada instans Ollama tempatan anda.
Bilangan alat meningkat daripada 20 ke 23. CLI ini baharu sama sekali -- ia bukan alat, ia ialah saluran penghantaran.
CLI CrawlForge Baharu
CLI ialah laluan terpendek daripada niat ke data yang di-scrape. Anda memasangnya sekali, menetapkan pemboleh ubah persekitaran, dan setiap alat CrawlForge menjadi satu arahan:
npm install -g crawlforge-mcp-server
export CRAWLFORGE_API_KEY="cf_live_your_key_here"
crawlforge scrape https://example.com
crawlforge search "best MCP servers 2026"
crawlforge research "AI agent frameworks" --depth deepMengapa ini penting? Kerana MCP hebat untuk ejen AI, tetapi banyak kerja scraping bukanlah tugas ejen AI. Ia ialah kerja cron. Langkah CI. Tarikan sekali sahaja daripada terminal anda. Untuk itu, anda mahukan JSON pada stdout yang menyalur masuk ke jq, bukan jabat tangan JSON-RPC.
Baca panduan lengkap CLI CrawlForge untuk rujukan arahan penuh dan aliran kerja dunia sebenar.
Extract With LLM: Pengekstrakan AI Tempatan
extract_with_llm ialah pengekstrakan berstruktur yang dikuasakan oleh model bahasa. Anda memberinya URL dan skema, ia mengembalikan JSON kepada anda. Bahagian baharunya ialah ia lalainya menggunakan Ollama tempatan dan bukannya memanggil OpenAI atau Anthropic.
// Pull structured data with a local model. No API key needed.
{
"url": "https://news.ycombinator.com/item?id=123456",
"schema": {
"type": "object",
"properties": {
"title": { "type": "string" },
"points": { "type": "number" },
"comments": { "type": "number" }
}
},
"provider": "ollama",
"model": "llama3.1:8b"
}Tiga perkara berikutan lalai tempatan-dahulu:
- Tiada kos API pihak ketiga. LLM adalah percuma. Anda hanya membayar 3 CrawlForge credits setiap pengekstrakan.
- Tiada data meninggalkan mesin anda. Kandungan yang di-scrape kekal pada localhost.
- Tiada API key baharu untuk diuruskan. Jika Ollama dipasang, anda sudah selesai.
OpenAI dan Anthropic masih disokong melalui provider: "openai" atau provider: "anthropic" untuk kes apabila anda mahukan model frontier. Panduan terperinci: ekstrak data dengan LLM tempatan.
Scrape Template: Sepuluh Tapak, Satu Panggilan
scrape_template adalah untuk ekor panjang permintaan scraping yang semuanya kelihatan sama: "dapatkan saya data produk daripada Amazon", "dapatkan saya metadata repo GitHub", "dapatkan saya pos teratas di Hacker News hari ini". Anda tidak sepatutnya perlu menulis pemilih CSS untuk ini. Kami melakukannya sekali, kami menyelenggaranya, anda memanggilnya.
crawlforge template amazon-product "https://www.amazon.com/dp/B0CHX1W1XY"
crawlforge template github-repo "https://github.com/anthropics/anthropic-sdk-python"
crawlforge template hacker-news-front-page "https://news.ycombinator.com"Sepuluh templat dihadirkan dalam keluaran ini:
| Templat | Apa yang dikembalikan | Credits |
|---|---|---|
amazon-product | Tajuk produk, harga, penilaian, ulasan, imej | 1 |
linkedin-profile | Nama profil, tajuk, lokasi, tentang | 1 |
github-repo | Metadata repo, bintang, bahasa, topik | 1 |
youtube-video | Tajuk video, tontonan, saluran, perihalan | 1 |
reddit-thread | Tajuk pos, skor, pengarang, badan | 1 |
hacker-news-front-page | Tajuk cerita halaman hadapan, mata, URL, komen | 1 |
stackoverflow-question | Soalan, jawapan, diterima, kiraan undi | 1 |
npm-package | Metadata pakej, muat turun mingguan, versi | 1 |
producthunt-launch | Nama produk, slogan, undi naik, topik | 1 |
tweet | Teks tweet, pengarang, URL, imej | 1 |
Panduan lengkap dengan kod: scrape Amazon, LinkedIn, dan GitHub dengan satu alat.
list_ollama_models: Penemuan Model
Paling berguna sebagai pemeriksaan kewarasan sebelum menjalankan extract_with_llm. Menyenaraikan setiap model pada instans Ollama tempatan anda dengan nama, saiz, dan tarikh diubah suai.
crawlforge extract --list-ollama-modelsBerharga 1 credit. Ia tidak melakukan scraping, tiada panggilan LLM -- ia hanya menanyakan API tempatan Ollama pada 127.0.0.1:11434 dan mengembalikan hasilnya. Jika anda pernah tertanya-tanya model manakah yang sebenarnya anda telah pasang, inilah jawapannya.
Aliran Kerja Lama vs Aliran Kerja v4.2.2
| Tugas | Pra-4.2.2 | v4.2.2 |
|---|---|---|
| Scrape daripada terminal anda | curl + penghurai tersuai, atau but Node REPL | crawlforge scrape <url> |
| Ekstrak data berstruktur dengan LLM | extract_structured (pemilih CSS) atau bina sendiri dengan Puppeteer + OpenAI | extract_with_llm (Ollama lalai) |
| Scrape Amazon, LinkedIn, GitHub | scrape_structured dengan pemilih diselenggara secara manual | scrape_template (kami menyelenggara pemilih) |
| Jalankan scraping dalam CI/cron | curl dengan API key dalam pengepala | crawlforge <cmd> dengan pemboleh ubah env |
Kos Credit
Tiga alat baharu mengikuti model kos credit sedia ada kami. Tiada kejutan:
| Alat | Credits | Mengapa |
|---|---|---|
list_ollama_models | 1 | Pembantu penemuan |
scrape_template | 1 | Satu halaman, skema pra-bina |
extract_with_llm | 3 | Inferens LLM (agnostik penyedia) |
CLI itu sendiri adalah percuma. Ia menggunakan API key sedia ada anda dan dikira terhadap baki credit biasa anda.
Cara Menaik Taraf
Pengguna sedia ada tidak perlu melakukan apa-apa. Alat baharu telah aktif pada semua pelan -- Free, Hobby, Professional, dan Business -- dan muncul secara automatik dalam klien MCP anda.
Jika anda mahukan CLI:
npm install -g crawlforge-mcp-server
export CRAWLFORGE_API_KEY="cf_live_..."
crawlforge --helpJika anda ingin mencuba pengekstrakan berkuasa Ollama:
# 1. Install Ollama (one-time)
curl -fsSL https://ollama.com/install.sh | sh
# 2. Pull a model (llama3.1:8b is a good start)
ollama pull llama3.1:8b
# 3. Run extraction through CrawlForge
crawlforge extract https://example.com --provider ollama --model llama3.1:8bApa yang Seterusnya
Kami sedang mengusahakan tiga perkara untuk 4.3:
- Lebih banyak templat -- Etsy, eBay, TikTok, Instagram, Google Maps. Hantar permintaan kepada kami di Discord.
- Penghantaran webhook untuk batch_scrape -- dapatkan hasil ditolak ke titik akhir anda apabila kerja jangka panjang selesai.
- Mod tonton CLI --
crawlforge track --watchuntuk diff langsung pada halaman yang dipantau.
Bersedia untuk mencuba alat baharu? Mulakan secara percuma dengan 1,000 credits -- tiada kad kredit diperlukan. Atau terus melompat ke panduan mendalam: panduan CLI, pengekstrakan LLM tempatan, dan sepuluh templat scrape.
Cuba sendiri — tiada pendaftaran diperlukan
Jalankan mana-mana daripada 27 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.
1,000 credits percuma • Isi semula setiap bulan • Tiada kad kredit diperlukan
Tag
Tentang Penulis
Kekal dikemas kini dengan pandangan terkini
Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.
Tiada spam. Berhenti melanggan bila-bila masa.