Log Perubahan
Jejaki setiap kemas kini CrawlForge
Baris 5.6: semua yang ditemui enam pusingan penuh merentas 29 alat dan 18 templat terhadap tapak sebenar, pelayan yang memandu model ke alat yang betul pada kali pertama, dan dalam 5.6.9 pelayar senyap yang melaporkan halaman ralat sebagai ralat dan menunggu dokumen kosong dipaparkan, perangkak yang mengekalkan garis miring hujung, dan templat Shopify yang membaca halaman produk apabila kedai menolak titik akhir JSONnya.
- Jadual data kekal dan kegagalan senyap hilang: extract_content, process_document dan scrape_with_actions melampirkan semula jadual yang digugurkan Readability; scrape mengekalkan pautan sebaris pada CSS bersarang asli; pengekstrakan LLM menjawab null dan bukannya mereka nilai; pengambilan halaman tidak menghantar Accept-Language; setiap laluan pengambilan menyahkod halaman mengikut set aksara yang diisytiharkan, jadi kakaku.com tidak lagi tiba sebagai mojibake; ejen menyemak setiap versi, tarikh dan angka dalam jawapannya terhadap sumber dan menamakan yang tidak dapat disokongnya; analyze_content memecah bahasa Hindi, Finland dan Jepun kepada perkataan
- Keputusan senyap yang jujur: stealth_mode melaporkan cabaran Cloudflare, DataDome, PerimeterX dan Vercel sebagai sekatan, dan kini halaman ralat HTTP atau sekatan lembut bertajuk sebagai kegagalan berserta kod statusnya, menunggu sehingga 8 saat untuk dokumen kosong dipaparkan dan melaporkan tempoh menunggu itu, mengekalkan konteks Chromium sepanjang pengambilan camoufox dan menyamar perkakasan di dalam Web Worker juga; scrape_with_actions menilai dokumen tempat rantaiannya berakhir
- crawl_deep mengambil URL dengan garis miring hujungnya (globalpetrolprices.com menjawab 404 kepada bentuk yang dipotong); deep_research mencari bentuk 12 perkataan bagi topik yang panjang (12 sumber di mana perenggan itu menemui satu); localization menetapkan Accept-Language mengikut negara yang dikonfigurasi; templat shopify-product membaca JSON-LD halaman produk apabila kedai menolak titik akhir JSONnya; reddit_search menerangkan keputusan kosong Arctic Shift
- Pemilihan alat: arahan pelayan ialah tangga keputusan dengan kos kredit dan peraturan jangan ambil semula, setiap penerangan alat menyatakan bila tidak perlu menggunakannya dan kosnya, scrape, search_web dan deep_research dimuatkan pada permulaan sesi, dan setiap keputusan ralat berakhir dengan langkah seterusnya yang menamakan alat untuk dicuba dan bukannya cubaan semula
Barisan 5.5: carian komen merentas seluruh Reddit, localization yang kini benar-benar menjalankan carian, dan satu siri panjang pembetulan ketepatan — termasuk contoh kod yang selama ini hilang secara senyap daripada halaman dokumentasi.
- reddit_search mencari komen merentas seluruh Reddit, dan localize_search kini menjalankan carian itu
- Setiap nombor daripada LLM disemak terhadap sumber halaman, atau dikembalikan sebagai null berserta sebabnya
- Perlindungan SSRF pada setiap laluan pelayar dan webhook, dan teks halaman dipagari sebelum sampai kepada model
Pengekstrakan Tahap 2: membaca keadaan JavaScript yang sedia ada pada halaman, bukan HTML yang dipaparkan. Satu permintaan, nilai tepat, tanpa LLM. Keluaran yang sama membetulkan sembilan kecacatan yang ditemui semasa menguji kesemua 29 alat pada tapak sebenar.
- extract_embedded_state baharu (2 credits) membaca __NEXT_DATA__, muatan React Server Component, Nuxt dan Apollo
- extract_metadata mendapat penapis json_ld_types yang turut memadankan subjenis
- Lima operasi track_changes yang dahulunya hanya mengembalikan ralat kini berfungsi
Kerja pematuhan dan identiti: setiap alat yang membuat permintaan menyemak robots.txt, permintaan yang ditolak tidak dikenakan bayaran, dan permintaan keluar ditandatangani supaya sesuatu tapak boleh mengesahkan perangkakan itu benar-benar daripada CrawlForge.
- Setiap alat yang membuat permintaan menyemak robots.txt, termasuk dua laluan stealth yang dahulunya terlepas
- Permintaan keluar ditandatangani mengikut RFC 9421 (Web Bot Auth), dengan direktori kunci yang diterbitkan
- Penolakan atas sebab pematuhan adalah percuma — ia tidak lagi menggunakan credits
Templat shopify-product yang membaca JSON kedai itu sendiri dan bukan menghurai halaman yang dipaparkan, sokongan Ollama jarak jauh, dan pengekstrak templat dipisahkan ke pakej npm sendiri supaya kedua-dua permukaan CrawlForge menggunakan satu pelaksanaan.
- Templat shopify-product: harga tepat, harga perbandingan dan stok setiap varian, tanpa menghurai HTML
- track_changes menilai perubahan harga yang sebenar, bukan berapa banyak ruang halaman yang berubah
- Ollama didaftarkan sebagai penyedia sebenar, memilih model terbaik yang dipasang
Carian Reddit yang sebenar, walaupun reddit.com menyekat setiap laluan langsung yang boleh diambil CrawlForge. Alat ini tidak pernah menyentuh reddit.com; ia menanyakan arkib komuniti sebaliknya. Ia percuma digunakan dan tidak memerlukan kelayakan.
- reddit_search (2 credits): carian kata kunci pada kiriman dan komen, serta keseluruhan pokok perbualan
- Disokong oleh arkib Arctic Shift dan PullPush, dengan satu cubaan semula terbatas apabila salah satunya sibuk
- Keputusan dinormalkan kepada permalink sebenar dan tarikh ISO, berserta nota kesegaran arkib
Keluaran utama: pengukuhan SSRF, OAuth, rahsia dan pengebilan, 52 pembetulan ketepatan termasuk crawl_deep yang ditulis semula, pengangkutan streamable-HTTP yang dibina semula, dan ciri spesifikasi MCP yang mula dijangka oleh klien.
- Output berstruktur (outputSchema) dan tugas tak segerak pada alat yang berjalan lama
- CRAWLFORGE_TOOLS dan CRAWLFORGE_TOOL_GROUPS mendedahkan sebahagian alat sahaja untuk mengurangkan konteks
- Sifar kerentanan npm audit, dan aras minimum Node dinaikkan kepada 20.16
Pelayan kini menghantar instructions MCP yang memberitahu mana-mana klien supaya mengutamakan alat CrawlForge berbanding carian web terbina dalamnya. Ia panduan, bukan penguatkuasaan — sebuah MCP server tidak boleh mematikan alat terbina klien.
- instructions MCP peringkat pelayan sampai kepada setiap klien pada pelancaran berikutnya, tanpa pemasangan semula
- Empat perihalan alat diperkukuh di tempat model membacanya, dalam tools/list
- serp_rank memulangkan senarai sepuluh teratas organik penuh bersama kedudukan domain sasaran
Alat ke-27. Ia melaporkan kedudukan sebenar sesuatu domain dalam keputusan organik Google bagi sesuatu kata kunci — kedudukan yang tidak dapat diberikan oleh API carian — disokong DataForSEO dan dibilkan kepada akaun anda sendiri.
- serp_rank (5 credits) memulangkan kedudukan terbaik, URL yang menduduki kedudukan itu, dan setiap kedudukan yang dipegang
- Tidak pernah mereka-reka kedudukan: ia melaporkan configured:false apabila DataForSEO tidak disediakan
- Pengebilan diperkukuh — panggilan tanpa kos tidak menghasilkan acara penggunaan, dan ralat dibil separuh
Claude Agent Skills yang mengaktifkan sendiri, dua kawalan keselamatan yang diiklankan tetapi sebenarnya tidak berfungsi kini dijadikan nyata, dan pemantauan perubahan yang benar-benar berjadual.
- Tujuh Claude Agent Skills dengan perihalan yang cukup untuk mengaktifkannya secara automatik
- SSRF dikuatkuasakan pada laluan scraping sebenar, disahkan pada permintaan awal dan setiap lompatan ubah hala
- Pemantau berjadual track_changes kekal dan memulihkan garis dasarnya selepas dimulakan semula