Pada halaman ini
Pada 20 Ogos 2026 kami menghantar empat keluaran tampalan dalam satu hari — v5.0.1, v5.0.2, v5.0.3 dan v5.0.4 — menutup 34 kecacatan. Tiada satu pun datang daripada laporan pepijat. Semuanya datang daripada satu idea yang lebih mudah: jalankan kesemua 27 alat MCP dan setiap subarahan CLI terhadap laman web sebenar yang hidup, dan nilai kandungan yang dipulangkan — bukan kod keluarnya.
v5.0.0 mengukuhkan pangkalan kod dari dalam: pemulihan tujuh fasa yang didorong oleh audit dalaman penuh. Tetapi audit membaca kod. Ia tidak dapat memberitahu anda bahawa reka letak GitHub tanpa log masuk sudah tidak lagi menghantar markup yang disasarkan templat anda, bahawa pakej huluan enjin senyap anda rosak secara senyap, atau bahawa agent penyelidikan anda mengambil halaman yang betul-betul tepat lalu mendakwa ia tidak boleh mengakses internet. Hanya trafik sebenar yang dapat memberitahu perkara itu.
Jadi itulah yang kami jalankan — tiga pusingan penuh, membaiki semua yang ditemui setiap pusingan sebelum menjalankan pusingan berikutnya.
Isi kandungan
- Apa yang disertakan dalam v5.0.1 hingga v5.0.4
- Cara kami menguji secara langsung sebuah pelayan MCP
- v5.0.1: 13 pembaikan, satu daripadanya kritikal
- v5.0.2: kualiti kandungan pada markup sebenar
- v5.0.3: 15 pembaikan dan enjin senyap yang dibaiki
- v5.0.4: alat agent akhirnya boleh menjawab
- Model tempatan manakah yang patut digunakan oleh agent?
- Perlukah saya mengubah apa-apa?
- Cara menaik taraf
- Apa yang seterusnya
Apa yang disertakan dalam v5.0.1 hingga v5.0.4
| Keluaran | Ditemui oleh | Pembaikan | Sorotan |
|---|---|---|---|
| v5.0.1 | Ujian langsung pusingan 1 | 13 | Kebuluran event loop crawl_deep dibaiki; CLI track/monitor berfungsi merentas seruan |
| v5.0.2 | Pusingan 1 (ditangguh) | 4 | Pengekstrakan entiti, pemilih harga, inventori llms.txt, templat GitHub |
| v5.0.3 | Ujian langsung pusingan 2 | 15 | Kualiti jawapan agent, enjin Camoufox dibaiki, monitor kekal di mana-mana |
| v5.0.4 | Ujian langsung pusingan 3 | 2 | Sintesis agent disahkan hujung ke hujung, resolusi kunci CLI |
Suite ujian unit meningkat daripada 914 kepada 980 ujian merentasi empat keluaran itu — setiap kecacatan mendapat ujian regresi sebelum pembaikannya dihantar — dan pematuhan protokol MCP kekal pada 100% sepanjang masa. Tiada skema alat, bentuk output mahupun kos credits yang berubah. Keempat-empatnya boleh terus dinaik taraf.
Cara kami menguji secara langsung sebuah pelayan MCP
Setiap pusingan ialah satu lintasan permukaan penuh: kesemua 27 alat diseru melalui MCP stdio, dan setiap subarahan CLI dijalankan dalam shell sebenar, terhadap laman web pengeluaran yang hidup — muka depan berita, katalog e-dagang, repositori GitHub, laman dokumentasi. Aliran kerja agent selari kemudiannya menilai apa yang dipulangkan. Adakah markdown itu bersih, atau teks yang terpateri? Adakah entiti yang diekstrak itu benar? Adakah jawapannya menyebut apa yang sebenarnya ada di halaman itu sekarang?
Soalan terakhir itulah intinya. HTTP 200 dengan output yang kelihatan munasabah ialah cara paling mudah untuk alat web scraping menjadi salah, dan ia tidak kelihatan kepada ujian unit mahupun audit kod. Semua kegagalan di bawah lulus CI. Beberapa daripadanya telah lulus CI selama beberapa keluaran.
v5.0.1: 13 pembaikan, satu daripadanya kritikal
Yang kritikal: crawl_deep boleh melaparkan seluruh pelayan. Bagi setiap pautan pada sesuatu halaman, perayap BFS menghurai semula keseluruhan HTML halaman — O(pautan × saiz halaman) CPU segerak. Pada halaman padat pautan, proses itu mengunci satu teras selama 13+ minit dengan memori bergiga-giga sementara event loop Node.js kebuluran: setiap panggilan MCP serentak tergantung, malah penutupan anggun pun tidak dapat berjalan. Halaman kini dihurai sekali dan diguna semula untuk setiap pautan.
Turut dalam crawl_deep: tugasan baris gilir serentak semuanya boleh lulus semakan max_pages sebelum mana-mana satu mendaftar, membiarkan perayapan melebihi had. Had itu kini tepat.
Selebihnya pusingan satu, secara ringkas:
serp_ranktidak lagi membuang carian berbayar. DataForSEO mengeluarkansnippet: nulluntuk hasil organik tanpa keterangan; skema output mewajibkan rentetan, lalu membuang respons yang sudah dibilkan. Kini boleh null.generate_llms_txtmenghormatianalysisOptions.maxPagesdanmaxDepth. Had itu tidak pernah sampai ke penganalisis sebelum ini.- CLI
stealthgagal pada setiap seruan lalai —--engineberlalai kepadaplaywright, nilai yang berhenti diterima oleh enum sejak v4.0.0. Lalai kinichromium, denganplaywrightdikekalkan sebagai alias. - CLI
trackakhirnya boleh membanding merentas seruan. Garis dasar hanya hidup dalam memori proses, jadi proses CLI baharu (atau pelayan MCP yang dimulakan semula) tiada apa-apa untuk dibandingkan. Garis dasar kini dihidratkan semula daripada snapshot terkini yang disimpan — sekali gus membaiki pepijat pendam sejak v4.8.0 di mana snapshot tersimpan kembali sebagai Buffer dan ditolak secara senyap oleh semakan jenis rentetan. monitor:stoptidak pernah bercakap benar. Ia melaporkanstopped: falsewalaupun berjaya, dan id monitor yang tidak dikenali menjadi tiada-operasi senyap. Kedua-dua laluan kini memuatkan stor dahulu dan melaporkan hasil sebenar.crawlforge initada dua pepijat persediaan. Mesin pencipta tidak lagi memerlukan API key untuk menjana konfigurasi. Dan entri MCP yang dijana menyerunpx -y crawlforge@latest— pakej yang tidak wujud. Pakej yang diterbitkan ialahcrawlforge-mcp-server, jadi setiap konfigurasi janaan init rosak sehingga disunting tangan. Dibaiki, dan konfigurasi kini menunjuk kepadacrawlforge-mcp-server@latest.- Snapshot perubahan menyimpan sampah. Setiap perubahan yang dikesan menulis snapshot kosong, kerana rekod perubahan membawa analisis diff dan bukannya kandungan. Snapshot kini hanya menyimpan kandungan sebenar, dan penghidratan semula melangkau yang kosong supaya stor yang tercemar masih boleh pulih.
Satu nota persekitaran untuk hos sendiri: stealth_mode, scrape_with_actions dan format screenshot scrape memerlukan pelayar Playwright dipasang — npx playwright install chromium.
v5.0.2: kualiti kandungan pada markup sebenar
Pusingan satu turut menandai empat alat yang berjaya sambil memulangkan kandungan yang merosot. Keempat-empatnya masalah markup di laman sebenar:
analyze_contentsentiasa memulangkan sifar entiti. Penganalisis memanggil kaedah NLP yang memerlukan pemalam yang tidak pernah kami pasang; lontaran itu menggugurkan keseluruhan pengekstrakan dan catch yang senyap memulangkan hasil kosong — walhal pengekstrakan orang, tempat dan organisasi berfungsi baik di bawahnya. Tarikh kini menggunakan padanan tag pustaka teras, dan "Apple and Microsoft announced record earnings in California" menghasilkan entiti yang anda jangkakan.extract_structuredmeninggalkan harga secara senyap. Pemilih literal.pricetidak boleh memadankan nama kelas sepertiprice_color. Jadual semantik kini merangkumi[itemprop="price"]dan[class*="price"].generate_llms_txttidak menghasilkan inventori halaman. Padanan subrentetan mengelaskan "S-api-ens" sebagai pautan API, dan satu positif palsu menindas keseluruhan sandaran peta laman. Pengesanan API kini menggunakan sempadan perkataan, dan senarai## Pagessentiasa dipaparkan untuk laman tanpa kategori.scrape_templatememulangkan watchers null dan topics kosong di GitHub. Reka letak React GitHub tanpa log masuk menggugurkan markup yang disasarkan pemilih lama. Pemilih baharu membaca reka letak semasa, dengan pemilih reka letak klasik dikekalkan sebagai sandaran.
v5.0.3: 15 pembaikan dan enjin senyap yang dibaiki
Pusingan dua pergi lebih dalam dan menemui lima belas lagi, tiga daripadanya struktural:
Alat agent berhenti mereka-reka jawapan. Penapisan baris mukadimah, bajet konteks sintesis per sumber dengan susunan keberkaitan, peraturan anti-fabrikasi yang jelas, dan jaminan bahawa laman yang dinamakan dalam prom anda diambil dahulu.
Enjin Camoufox telah rosak secara senyap sejak v5.0.0. Titik masuk ESM Camoufox ialah bundle esbuild yang rosak, jadi memuatkannya terus gagal — yang turut melumpuhkan sandaran anti-bot deep_research tanpa sebarang ralat kelihatan. Pembaikan memuatkannya melalui CJS, menggunakan API Camoufox() sebenar, dan mencipta konteks viewport: null untuk memintas ketidakpadanan protokol playwright-core/Firefox.
Monitor berjadual kini kekal dalam ~/.crawlforge/monitors. Sebelum ini ia menulis ke direktori ./monitors relatif kepada tempat proses bermula, jadi monitor:list, monitor:stop dan aliran kerja cron hanya berfungsi dari direktori itu sahaja. Stor lama berhijrah secara automatik.
Dua belas selebihnya ialah pembaikan kualiti kandungan merentasi permukaan: keserupaan track_changes dihadkan kepada [0,1] dengan statistik garis dasar sebenar, markdown batch_scrape mengekalkan kandungan span dan small, extract_text membuang blok noscript, tarikh Perancis diformat DD/MM/YYYY dalam localization, ringkasan ekstraktif menyertakan ayat pembuka, analyze_content memulangkan topik sebenar, scrape_with_actions menghormati koordinat skrol dan melaporkan scrolledTo, pautan llms.txt mendapat tajuk halaman sebenar, dan banyak lagi — kira-kira 50 ujian regresi baharu dalam keluaran ini sahaja.
v5.0.4: alat agent akhirnya boleh menjawab
Pusingan ketiga tinggal satu kecacatan keras, dan ia pepijat paling menarik hari itu.
Alat agent akan mengambil halaman yang betul-betul tepat — HTTP 200, bukti direkodkan — kemudian menjawab "I'm unable to access the internet". Tiga punca yang saling berkait, setiap satu disahkan tidak mencukupi untuk dibaiki bersendirian:
- Peratasan teks memusnahkan struktur. Teks halaman diruntuhkan dengan regex ruang putih yang memateri elemen blok bersebelahan menjadi satu rentetan: senarai berperingkat menjadi "1.Story title329 points". Perata baharu menandai sempadan elemen blok sebelum meruntuhkan, jadi setiap baris jadual dan item senarai kekal sebagai barisnya sendiri.
- Susunan sumber mengabaikan niat anda. Sumber sintesis disusun semata-mata mengikut pertindihan istilah prom, jadi artikel generik yang mengandungi perkataan tugasan boleh mengatasi laman yang dinamakan secara eksplisit oleh prom. URL benih dan laman yang dinamakan prom kini membawa dorongan keutamaan tetap melebihi sebarang skor pertindihan istilah.
- Model tempatan kecil menolak input yang betul-betul baik. Prom sintesis kini menyatakan bahawa sumber sudah pun diambil dan melarang penolakan atas alasan tiada keupayaan melayari.
Dengan ketiga-tiganya tersedia, agent — berjalan secara langsung melalui MCP stdio — menyebut cerita #1 Hacker News semasa yang sebenar. Itulah penanda aras hujung ke hujung yang mesti dilepasi setiap keluaran akan datang.
v5.0.4 turut membaiki CLI search yang mengabaikan API key yang disimpan oleh crawlforge setup: kunci dibaca daripada persekitaran pada masa import, sebelum cangkuk resolusi kunci CLI berjalan. Ia kini diselesaikan pada masa panggilan.
Model tempatan manakah yang patut digunakan oleh agent?
Satu penemuan daripada kerja sintesis ini wajar diambil tindakan jika anda menjalankan alat agent dengan model Ollama tempatan. Pada prom sintesis berbilang sumber sebenar ~13KB, llama3.2 — lalai kod — masih gagal sedangkan qwen2.5:3b (saiz 3B yang sama), mistral:7b dan gemma3:12b semuanya berjaya.
Lalai kekal llama3.2 demi keserasian ekosistem, tetapi jika jawapan agent merosot secara tempatan, tukarlah:
export OLLAMA_DEFAULT_MODEL=qwen2.5:3bPerlukah saya mengubah apa-apa?
Tidak. Keempat-empat keluaran ialah tampalan: tiada skema alat, bentuk output mahupun kos credits yang berubah, jumlah alat kekal 27, dan harga tidak disentuh. Had minimum Node.js >= 20.16.0 daripada v5.0.0 masih terpakai.
Satu pengecualian: jika anda pernah menjalankan crawlforge init sebelum v5.0.1 dan konfigurasi klien MCP anda menyeru crawlforge@latest, entri itu tidak pernah berfungsi — jalankan semula crawlforge init atau tunjukkannya kepada crawlforge-mcp-server@latest.
Cara menaik taraf
npm install -g crawlforge-mcp-server@latestPengguna baharu:
npm install -g crawlforge-mcp-server
npx crawlforge initPengguna klien MCP sedia ada hanya perlu mencetuskan penyambungan semula /mcp. Rekod penuh kecacatan demi kecacatan bagi keempat-empat keluaran ada dalam changelog dan di halaman keluaran.
Apa yang seterusnya
Ujian langsung permukaan penuh kini sebahagian daripada pintu keluaran, bukan aktiviti sekali sahaja: setiap keluaran akan datang mendapat larian langsung kesemua 27 alat terhadap laman sebenar sebelum ia dihantar. Landasan v5.0.0 yang ditangguhkan — titik akhir jauh terhos dengan OAuth, pemantauan berjadual sebagai perkhidmatan, sesi berterusan — kekal beratur di belakangnya.
Dan jemputan tetap itu masih terbuka: jika sesuatu alat memulangkan kandungan yang tidak sepadan dengan apa yang sebenarnya ada di halaman, itulah pepijat yang kami mahu dengar.
Sedia untuk mencubanya? Mulakan percuma dengan 1,000 credits — kemudian jalankan npx crawlforge init untuk mendaftarkan pelayan MCP. Lihat dokumentasi penuh atau catatan keluaran v5.0.0 untuk baik pulih yang menjadi asas keluaran ini.
Cuba sendiri — tiada pendaftaran diperlukan
Jalankan mana-mana daripada 28 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.
1,000 credits percuma • Sekali sahaja • Tiada kad kredit diperlukan
Tag
Tentang Penulis
Kekal dikemas kini dengan pandangan terkini
Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.
Tiada spam. Berhenti melanggan bila-bila masa.