CrawlForge MCP
Laman UtamaPlaygroundKes PenggunaanIntegrasiHargaDokumentasiBlog
CrawlForge v5.0.4: 34 pembaikan daripada ujian langsung 27 alat MCP
Product Updates
Kembali ke Blog
Kemas Kini Produk

CrawlForge v5.0.4: 34 pembaikan daripada ujian langsung 27 alat MCP

C
CrawlForge Team
Pasukan Kejuruteraan
20 Ogos 2026
10 min bacaan

Pada halaman ini

Jawapan Pantas

Pada 20 Ogos 2026, CrawlForge mengeluarkan empat keluaran tampalan — v5.0.1 hingga v5.0.4 — yang membaiki 34 kecacatan hasil tiga pusingan ujian langsung permukaan penuh: kesemua 27 alat MCP dan setiap subarahan CLI dijalankan terhadap laman web sebenar, dengan kandungan yang dipulangkan dinilai kualitinya dan bukan sekadar disemak berjaya atau tidak. Pembaikan utama: pepijat kebuluran event loop yang kritikal dalam crawl_deep, alat agent kini menjawab dengan betul daripada halaman yang diambilnya, enjin senyap Camoufox dibaiki, monitor berjadual kini kekal dalam ~/.crawlforge/monitors dari mana-mana direktori, dan arahan init tidak lagi menulis konfigurasi yang menunjuk kepada pakej npm yang tidak wujud. Suite ujian unit meningkat daripada 914 kepada 980 ujian. Tiada skema alat, bentuk output mahupun kos credits yang berubah — keempat-empat keluaran boleh terus dinaik taraf bagi sesiapa yang sudah berada di v5.0.0.

Pada 20 Ogos 2026 kami menghantar empat keluaran tampalan dalam satu hari — v5.0.1, v5.0.2, v5.0.3 dan v5.0.4 — menutup 34 kecacatan. Tiada satu pun datang daripada laporan pepijat. Semuanya datang daripada satu idea yang lebih mudah: jalankan kesemua 27 alat MCP dan setiap subarahan CLI terhadap laman web sebenar yang hidup, dan nilai kandungan yang dipulangkan — bukan kod keluarnya.

v5.0.0 mengukuhkan pangkalan kod dari dalam: pemulihan tujuh fasa yang didorong oleh audit dalaman penuh. Tetapi audit membaca kod. Ia tidak dapat memberitahu anda bahawa reka letak GitHub tanpa log masuk sudah tidak lagi menghantar markup yang disasarkan templat anda, bahawa pakej huluan enjin senyap anda rosak secara senyap, atau bahawa agent penyelidikan anda mengambil halaman yang betul-betul tepat lalu mendakwa ia tidak boleh mengakses internet. Hanya trafik sebenar yang dapat memberitahu perkara itu.

Jadi itulah yang kami jalankan — tiga pusingan penuh, membaiki semua yang ditemui setiap pusingan sebelum menjalankan pusingan berikutnya.

Isi kandungan

  • Apa yang disertakan dalam v5.0.1 hingga v5.0.4
  • Cara kami menguji secara langsung sebuah pelayan MCP
  • v5.0.1: 13 pembaikan, satu daripadanya kritikal
  • v5.0.2: kualiti kandungan pada markup sebenar
  • v5.0.3: 15 pembaikan dan enjin senyap yang dibaiki
  • v5.0.4: alat agent akhirnya boleh menjawab
  • Model tempatan manakah yang patut digunakan oleh agent?
  • Perlukah saya mengubah apa-apa?
  • Cara menaik taraf
  • Apa yang seterusnya

Apa yang disertakan dalam v5.0.1 hingga v5.0.4

KeluaranDitemui olehPembaikanSorotan
v5.0.1Ujian langsung pusingan 113Kebuluran event loop crawl_deep dibaiki; CLI track/monitor berfungsi merentas seruan
v5.0.2Pusingan 1 (ditangguh)4Pengekstrakan entiti, pemilih harga, inventori llms.txt, templat GitHub
v5.0.3Ujian langsung pusingan 215Kualiti jawapan agent, enjin Camoufox dibaiki, monitor kekal di mana-mana
v5.0.4Ujian langsung pusingan 32Sintesis agent disahkan hujung ke hujung, resolusi kunci CLI

Suite ujian unit meningkat daripada 914 kepada 980 ujian merentasi empat keluaran itu — setiap kecacatan mendapat ujian regresi sebelum pembaikannya dihantar — dan pematuhan protokol MCP kekal pada 100% sepanjang masa. Tiada skema alat, bentuk output mahupun kos credits yang berubah. Keempat-empatnya boleh terus dinaik taraf.

Cara kami menguji secara langsung sebuah pelayan MCP

Setiap pusingan ialah satu lintasan permukaan penuh: kesemua 27 alat diseru melalui MCP stdio, dan setiap subarahan CLI dijalankan dalam shell sebenar, terhadap laman web pengeluaran yang hidup — muka depan berita, katalog e-dagang, repositori GitHub, laman dokumentasi. Aliran kerja agent selari kemudiannya menilai apa yang dipulangkan. Adakah markdown itu bersih, atau teks yang terpateri? Adakah entiti yang diekstrak itu benar? Adakah jawapannya menyebut apa yang sebenarnya ada di halaman itu sekarang?

Soalan terakhir itulah intinya. HTTP 200 dengan output yang kelihatan munasabah ialah cara paling mudah untuk alat web scraping menjadi salah, dan ia tidak kelihatan kepada ujian unit mahupun audit kod. Semua kegagalan di bawah lulus CI. Beberapa daripadanya telah lulus CI selama beberapa keluaran.

v5.0.1: 13 pembaikan, satu daripadanya kritikal

Yang kritikal: crawl_deep boleh melaparkan seluruh pelayan. Bagi setiap pautan pada sesuatu halaman, perayap BFS menghurai semula keseluruhan HTML halaman — O(pautan × saiz halaman) CPU segerak. Pada halaman padat pautan, proses itu mengunci satu teras selama 13+ minit dengan memori bergiga-giga sementara event loop Node.js kebuluran: setiap panggilan MCP serentak tergantung, malah penutupan anggun pun tidak dapat berjalan. Halaman kini dihurai sekali dan diguna semula untuk setiap pautan.

Turut dalam crawl_deep: tugasan baris gilir serentak semuanya boleh lulus semakan max_pages sebelum mana-mana satu mendaftar, membiarkan perayapan melebihi had. Had itu kini tepat.

Selebihnya pusingan satu, secara ringkas:

  • serp_rank tidak lagi membuang carian berbayar. DataForSEO mengeluarkan snippet: null untuk hasil organik tanpa keterangan; skema output mewajibkan rentetan, lalu membuang respons yang sudah dibilkan. Kini boleh null.
  • generate_llms_txt menghormati analysisOptions.maxPages dan maxDepth. Had itu tidak pernah sampai ke penganalisis sebelum ini.
  • CLI stealth gagal pada setiap seruan lalai — --engine berlalai kepada playwright, nilai yang berhenti diterima oleh enum sejak v4.0.0. Lalai kini chromium, dengan playwright dikekalkan sebagai alias.
  • CLI track akhirnya boleh membanding merentas seruan. Garis dasar hanya hidup dalam memori proses, jadi proses CLI baharu (atau pelayan MCP yang dimulakan semula) tiada apa-apa untuk dibandingkan. Garis dasar kini dihidratkan semula daripada snapshot terkini yang disimpan — sekali gus membaiki pepijat pendam sejak v4.8.0 di mana snapshot tersimpan kembali sebagai Buffer dan ditolak secara senyap oleh semakan jenis rentetan.
  • monitor:stop tidak pernah bercakap benar. Ia melaporkan stopped: false walaupun berjaya, dan id monitor yang tidak dikenali menjadi tiada-operasi senyap. Kedua-dua laluan kini memuatkan stor dahulu dan melaporkan hasil sebenar.
  • crawlforge init ada dua pepijat persediaan. Mesin pencipta tidak lagi memerlukan API key untuk menjana konfigurasi. Dan entri MCP yang dijana menyeru npx -y crawlforge@latest — pakej yang tidak wujud. Pakej yang diterbitkan ialah crawlforge-mcp-server, jadi setiap konfigurasi janaan init rosak sehingga disunting tangan. Dibaiki, dan konfigurasi kini menunjuk kepada crawlforge-mcp-server@latest.
  • Snapshot perubahan menyimpan sampah. Setiap perubahan yang dikesan menulis snapshot kosong, kerana rekod perubahan membawa analisis diff dan bukannya kandungan. Snapshot kini hanya menyimpan kandungan sebenar, dan penghidratan semula melangkau yang kosong supaya stor yang tercemar masih boleh pulih.

Satu nota persekitaran untuk hos sendiri: stealth_mode, scrape_with_actions dan format screenshot scrape memerlukan pelayar Playwright dipasang — npx playwright install chromium.

v5.0.2: kualiti kandungan pada markup sebenar

Pusingan satu turut menandai empat alat yang berjaya sambil memulangkan kandungan yang merosot. Keempat-empatnya masalah markup di laman sebenar:

  • analyze_content sentiasa memulangkan sifar entiti. Penganalisis memanggil kaedah NLP yang memerlukan pemalam yang tidak pernah kami pasang; lontaran itu menggugurkan keseluruhan pengekstrakan dan catch yang senyap memulangkan hasil kosong — walhal pengekstrakan orang, tempat dan organisasi berfungsi baik di bawahnya. Tarikh kini menggunakan padanan tag pustaka teras, dan "Apple and Microsoft announced record earnings in California" menghasilkan entiti yang anda jangkakan.
  • extract_structured meninggalkan harga secara senyap. Pemilih literal .price tidak boleh memadankan nama kelas seperti price_color. Jadual semantik kini merangkumi [itemprop="price"] dan [class*="price"].
  • generate_llms_txt tidak menghasilkan inventori halaman. Padanan subrentetan mengelaskan "S-api-ens" sebagai pautan API, dan satu positif palsu menindas keseluruhan sandaran peta laman. Pengesanan API kini menggunakan sempadan perkataan, dan senarai ## Pages sentiasa dipaparkan untuk laman tanpa kategori.
  • scrape_template memulangkan watchers null dan topics kosong di GitHub. Reka letak React GitHub tanpa log masuk menggugurkan markup yang disasarkan pemilih lama. Pemilih baharu membaca reka letak semasa, dengan pemilih reka letak klasik dikekalkan sebagai sandaran.

v5.0.3: 15 pembaikan dan enjin senyap yang dibaiki

Pusingan dua pergi lebih dalam dan menemui lima belas lagi, tiga daripadanya struktural:

Alat agent berhenti mereka-reka jawapan. Penapisan baris mukadimah, bajet konteks sintesis per sumber dengan susunan keberkaitan, peraturan anti-fabrikasi yang jelas, dan jaminan bahawa laman yang dinamakan dalam prom anda diambil dahulu.

Enjin Camoufox telah rosak secara senyap sejak v5.0.0. Titik masuk ESM Camoufox ialah bundle esbuild yang rosak, jadi memuatkannya terus gagal — yang turut melumpuhkan sandaran anti-bot deep_research tanpa sebarang ralat kelihatan. Pembaikan memuatkannya melalui CJS, menggunakan API Camoufox() sebenar, dan mencipta konteks viewport: null untuk memintas ketidakpadanan protokol playwright-core/Firefox.

Monitor berjadual kini kekal dalam ~/.crawlforge/monitors. Sebelum ini ia menulis ke direktori ./monitors relatif kepada tempat proses bermula, jadi monitor:list, monitor:stop dan aliran kerja cron hanya berfungsi dari direktori itu sahaja. Stor lama berhijrah secara automatik.

Dua belas selebihnya ialah pembaikan kualiti kandungan merentasi permukaan: keserupaan track_changes dihadkan kepada [0,1] dengan statistik garis dasar sebenar, markdown batch_scrape mengekalkan kandungan span dan small, extract_text membuang blok noscript, tarikh Perancis diformat DD/MM/YYYY dalam localization, ringkasan ekstraktif menyertakan ayat pembuka, analyze_content memulangkan topik sebenar, scrape_with_actions menghormati koordinat skrol dan melaporkan scrolledTo, pautan llms.txt mendapat tajuk halaman sebenar, dan banyak lagi — kira-kira 50 ujian regresi baharu dalam keluaran ini sahaja.

v5.0.4: alat agent akhirnya boleh menjawab

Pusingan ketiga tinggal satu kecacatan keras, dan ia pepijat paling menarik hari itu.

Alat agent akan mengambil halaman yang betul-betul tepat — HTTP 200, bukti direkodkan — kemudian menjawab "I'm unable to access the internet". Tiga punca yang saling berkait, setiap satu disahkan tidak mencukupi untuk dibaiki bersendirian:

  1. Peratasan teks memusnahkan struktur. Teks halaman diruntuhkan dengan regex ruang putih yang memateri elemen blok bersebelahan menjadi satu rentetan: senarai berperingkat menjadi "1.Story title329 points". Perata baharu menandai sempadan elemen blok sebelum meruntuhkan, jadi setiap baris jadual dan item senarai kekal sebagai barisnya sendiri.
  2. Susunan sumber mengabaikan niat anda. Sumber sintesis disusun semata-mata mengikut pertindihan istilah prom, jadi artikel generik yang mengandungi perkataan tugasan boleh mengatasi laman yang dinamakan secara eksplisit oleh prom. URL benih dan laman yang dinamakan prom kini membawa dorongan keutamaan tetap melebihi sebarang skor pertindihan istilah.
  3. Model tempatan kecil menolak input yang betul-betul baik. Prom sintesis kini menyatakan bahawa sumber sudah pun diambil dan melarang penolakan atas alasan tiada keupayaan melayari.

Dengan ketiga-tiganya tersedia, agent — berjalan secara langsung melalui MCP stdio — menyebut cerita #1 Hacker News semasa yang sebenar. Itulah penanda aras hujung ke hujung yang mesti dilepasi setiap keluaran akan datang.

v5.0.4 turut membaiki CLI search yang mengabaikan API key yang disimpan oleh crawlforge setup: kunci dibaca daripada persekitaran pada masa import, sebelum cangkuk resolusi kunci CLI berjalan. Ia kini diselesaikan pada masa panggilan.

Model tempatan manakah yang patut digunakan oleh agent?

Satu penemuan daripada kerja sintesis ini wajar diambil tindakan jika anda menjalankan alat agent dengan model Ollama tempatan. Pada prom sintesis berbilang sumber sebenar ~13KB, llama3.2 — lalai kod — masih gagal sedangkan qwen2.5:3b (saiz 3B yang sama), mistral:7b dan gemma3:12b semuanya berjaya.

Lalai kekal llama3.2 demi keserasian ekosistem, tetapi jika jawapan agent merosot secara tempatan, tukarlah:

Bash
export OLLAMA_DEFAULT_MODEL=qwen2.5:3b

Perlukah saya mengubah apa-apa?

Tidak. Keempat-empat keluaran ialah tampalan: tiada skema alat, bentuk output mahupun kos credits yang berubah, jumlah alat kekal 27, dan harga tidak disentuh. Had minimum Node.js >= 20.16.0 daripada v5.0.0 masih terpakai.

Satu pengecualian: jika anda pernah menjalankan crawlforge init sebelum v5.0.1 dan konfigurasi klien MCP anda menyeru crawlforge@latest, entri itu tidak pernah berfungsi — jalankan semula crawlforge init atau tunjukkannya kepada crawlforge-mcp-server@latest.

Cara menaik taraf

Bash
npm install -g crawlforge-mcp-server@latest

Pengguna baharu:

Bash
npm install -g crawlforge-mcp-server
npx crawlforge init

Pengguna klien MCP sedia ada hanya perlu mencetuskan penyambungan semula /mcp. Rekod penuh kecacatan demi kecacatan bagi keempat-empat keluaran ada dalam changelog dan di halaman keluaran.

Apa yang seterusnya

Ujian langsung permukaan penuh kini sebahagian daripada pintu keluaran, bukan aktiviti sekali sahaja: setiap keluaran akan datang mendapat larian langsung kesemua 27 alat terhadap laman sebenar sebelum ia dihantar. Landasan v5.0.0 yang ditangguhkan — titik akhir jauh terhos dengan OAuth, pemantauan berjadual sebagai perkhidmatan, sesi berterusan — kekal beratur di belakangnya.

Dan jemputan tetap itu masih terbuka: jika sesuatu alat memulangkan kandungan yang tidak sepadan dengan apa yang sebenarnya ada di halaman, itulah pepijat yang kami mahu dengar.


Sedia untuk mencubanya? Mulakan percuma dengan 1,000 credits — kemudian jalankan npx crawlforge init untuk mendaftarkan pelayan MCP. Lihat dokumentasi penuh atau catatan keluaran v5.0.0 untuk baik pulih yang menjadi asas keluaran ini.

Cuba sendiri — tiada pendaftaran diperlukan

Jalankan mana-mana daripada 28 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.

1,000 credits percuma • Sekali sahaja • Tiada kad kredit diperlukan

Tag

releasev5.0.4MCPweb scrapingtestingchangelog

Tentang Penulis

C

CrawlForge Team

Pasukan Kejuruteraan

Membina MCP server web scraping yang paling menyeluruh. Kami mencipta alatan yang membantu pembangun mengekstrak, menganalisis dan mengubah data web untuk aplikasi AI.

Kekal dikemas kini dengan pandangan terkini

Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.

Tiada spam. Berhenti melanggan bila-bila masa.

Praktikkan ini

Uji alat CrawlForge pada mana-mana URL — percuma, tanpa pendaftaran.

Pada halaman ini

Frequently Asked Questions

Apakah yang berubah dalam CrawlForge v5.0.1 hingga v5.0.4?+

Keempat-empat keluaran dihantar pada 20 Ogos 2026 dan bersama-sama menutup 34 kecacatan yang ditemui oleh tiga pusingan ujian langsung permukaan penuh — menjalankan kesemua 27 alat MCP dan setiap subarahan CLI terhadap laman web sebenar dan menilai kandungan yang dipulangkan. Sorotan: pembaikan kritikal kebuluran event loop dalam crawl_deep, garis dasar penjejakan perubahan yang berfungsi merentas seruan, empat pembaikan kualiti kandungan terhadap markup dunia sebenar, enjin senyap Camoufox yang dibaiki, monitor berjadual yang kekal dalam ~/.crawlforge/monitors, dan alat agent yang kini menjawab dengan betul daripada halaman yang diambilnya. Suite ujian unit meningkat daripada 914 kepada 980 ujian, dengan pematuhan protokol MCP pada 100% sepanjang masa.

Adakah v5.0.1 hingga v5.0.4 perubahan yang memecahkan keserasian?+

Tidak. Keempat-empatnya keluaran tampalan: tiada skema alat, bentuk output mahupun kos credits yang berubah, jumlah alat kekal 27, dan harga tidak disentuh. Satu-satunya keperluan yang dibawa daripada v5.0.0 ialah had minimum Node.js 20.16.0 atau lebih baharu. Satu peringatan: konfigurasi klien MCP yang dijana oleh crawlforge init sebelum v5.0.1 menunjuk kepada pakej npm yang tidak wujud (crawlforge dan bukannya crawlforge-mcp-server) dan tidak pernah berfungsi — jalankan semula crawlforge init untuk menjananya semula.

Mengapa alat agent CrawlForge memberikan jawapan salah sebelum v5.0.4?+

Tiga punca yang saling berkait, setiap satu disahkan tidak mencukupi untuk dibaiki bersendirian. Pertama, teks halaman diruntuhkan dengan regex ruang putih yang memateri elemen blok bersebelahan menjadi satu rentetan, memusnahkan senarai dan jadual. Kedua, sumber sintesis disusun semata-mata mengikut pertindihan istilah prom, jadi artikel generik boleh mengatasi laman yang dinamakan secara eksplisit oleh prom — URL benih dan laman yang dinamakan prom kini membawa dorongan keutamaan tetap. Ketiga, model tempatan kecil menolak walaupun input tersusun betul; prom sintesis kini menyatakan bahawa sumber sudah pun diambil dan melarang penolakan atas alasan tiada keupayaan melayari. Pembaikan itu disahkan secara langsung: agent menyebut cerita #1 Hacker News semasa yang sebenar melalui MCP stdio.

Model Ollama manakah paling sesuai dengan alat agent CrawlForge?+

Pada prom sintesis berbilang sumber sebenar ~13KB, llama3.2 — lalai kod — masih gagal sedangkan qwen2.5:3b (saiz 3B yang sama), mistral:7b dan gemma3:12b semuanya berjaya. Lalai kekal llama3.2 demi keserasian ekosistem, jadi jika jawapan agent merosot secara tempatan, tetapkan OLLAMA_DEFAULT_MODEL=qwen2.5:3b dalam persekitaran tempat pelayan MCP berjalan.

Mengapa monitor berjadual hanya berfungsi dari satu direktori sebelum v5.0.3?+

Monitor berjadual dahulunya kekal dalam direktori ./monitors relatif kepada tempat proses bermula, jadi monitor:list, monitor:stop dan aliran kerja cron hanya menemuinya apabila dijalankan dari direktori kerja yang sama. Sejak v5.0.3, monitor kekal dalam ~/.crawlforge/monitors tanpa mengira direktori kerja, dan stor ./monitors lama berhijrah secara automatik semasa versi baharu dijalankan buat kali pertama.

Artikel Berkaitan

CrawlForge MCP v5.1.0: cari Reddit tanpa API
Product Updates

CrawlForge MCP v5.1.0: cari Reddit tanpa API

reddit.com menyekat setiap scraper kami — jadi v5.1.0 menghantar reddit_search, alat ke-28 yang mencari post dan komen serta membaca thread penuh melalui arkib komuniti. Tanpa API key Reddit, tanpa kelayakan, 2 credits.

C
CrawlForge Team
|
24 Ogo
|
9m
CrawlForge v5.0.0: keselamatan, ketepatan, spesifikasi MCP
Product Updates

CrawlForge v5.0.0: keselamatan, ketepatan, spesifikasi MCP

CrawlForge MCP v5.0.0 menghimpunkan pemulihan keselamatan dan ketepatan tujuh fasa: sifar kerentanan npm audit, 914 ujian, dan penggunaan penuh spesifikasi MCP.

C
CrawlForge Team
|
13 Ogo
|
12m
CrawlForge v4.8.0: Claude Skills yang Aktif Secara Automatik
Product Updates

CrawlForge v4.8.0: Claude Skills yang Aktif Secara Automatik

CrawlForge MCP v4.8.0 menghadirkan 7 Claude Agent Skills yang aktif secara automatik untuk 26 alatnya, perlindungan SSRF yang dikuatkuasakan, screenshot yang berfungsi, format branding berasaskan design tokens, dan pemantauan perubahan berjadual terbina dalam.

C
CrawlForge Team
|
28 Jun
|
8m

Footer

CrawlForge MCP

Web scraping gred perusahaan untuk Ejen AI. 28 alat MCP khusus yang direka untuk pembangun moden yang membina sistem pintar.

Produk

  • Ciri
  • Playground
  • Harga
  • Kes Penggunaan
  • Integrasi
  • Alternatif
  • Changelog

Sumber

  • Mula Bekerja
  • Rujukan API
  • Templat
  • Panduan
  • Blog
  • Glosari
  • Soalan Lazim
  • Peta Laman

Pembangun

  • Protokol MCP
  • Claude Desktop
  • Cursor IDE
  • LangChain
  • LlamaIndex

Syarikat

  • Tentang
  • Hubungi
  • Privasi
  • Terma
  • Penggunaan Boleh Diterima
  • Cookies

Kekal dikemas kini

Dapatkan kemas kini terkini tentang alat dan ciri baharu.

Dibina dengan Next.js dan protokol MCP

© 2025-2026 CrawlForge. Hak cipta terpelihara.