Langkau ke kandungan

Kes Penggunaan

Kumpul iklan daripada papan pekerjaan yang berhalaman, memuat malas atau perlu log masuk. Pandu pelayar sebenar dahulu, kemudian petakan semuanya ke satu skema JSON.
Anggaran kos: ~8 credits setiap halaman papan

01Jawapan Pantas

Gunakan scrape_with_actions (5 credits) untuk mengklik "muat lagi", menatal, atau log masuk supaya iklan benar-benar dipaparkan, kemudian extract_structured (3 credits) untuk memetakan setiap iklan kepada skema JSON anda sendiri -- jawatan, lokasi, gaji, penanda kerja jarak jauh. Lebih kurang 8 credits setiap halaman papan, dan satu skema merangkumi papan dengan markup yang berbeza.

02Ringkasan

Masalahnya

Papan pekerjaan menyembunyikan iklannya di sebalik butang "muat lagi", tatal tanpa henti, dan dinding log masuk, jadi pengambilan HTTP biasa hanya memulangkan cengkerang kosong. Setiap papan juga menamakan medannya secara berbeza, yang merosakkan scraper berasaskan pemilih pada reka bentuk semula berikutnya.

Penyelesaiannya

scrape_with_actions CrawlForge memandu pelayar sebenar -- klik, taip, tatal, tunggu -- supaya iklan dipaparkan sebelum pengekstrakan, dan extract_structured memetakan apa jua markup yang digunakan sesebuah papan kepada satu skema JSON yang anda tentukan.

03Dalam kod

Contoh Kod

job-listing-aggregation.js
// Load a paginated board, then extract each posting as JSONconst board = await mcp.scrape_with_actions({  url: "https://boards.example.com/jobs?team=engineering",  actions: [    { type: "wait", selector: ".job-card", condition: "visible" },    { type: "click", selector: "button.load-more", clickCount: 3 },    { type: "scroll", direction: "down", distance: 4000 },  ],  formats: ["json", "markdown"],}); // One schema, any board layoutconst posting = await mcp.extract_structured({  url: "https://boards.example.com/jobs/senior-backend-engineer",  schema: {    type: "object",    properties: {      title: { type: "string" },      location: { type: "string" },      salaryRange: { type: "string" },      remote: { type: "boolean" },      postedAt: { type: "string" },    },    required: ["title"],  },}); console.log(posting.data);

04Saluran paip

Alat Digunakan

11◆ credits
Anggaran kos: ~8 credits setiap halaman papan
  1. https://…
  2. 01scrape_with_actions 5 credits
  3. 02extract_structured 3 credits
  4. 03browser_session 3 credits
  5. JSON · markdown

05Soalan

Soalan Lazim

01Bagaimana saya boleh scrape papan pekerjaan yang menggunakan tatal tanpa henti?

Gunakan scrape_with_actions untuk memandu pelayar sebenar: tunggu pemilih iklan, klik butang muat lagi, dan tatal sebelum pengekstrakan berjalan. Iklan dipaparkan dahulu, jadi anda mendapat kandungan sebenar dan bukannya cengkerang kosong.

02Bolehkah CrawlForge scrape halaman di sebalik log masuk?

Ya. scrape_with_actions menyokong tindakan type dan click serta formAutoFill, jadi ia boleh menghantar kelayakan dan scrape halaman yang menyusul. Log masuk hanya ke akaun yang anda miliki atau yang anda dibenarkan akses.

03Bagaimana saya boleh menyeragamkan iklan daripada papan dengan markup yang berbeza?

Tentukan satu skema JSON — jawatan, lokasi, julat gaji, penanda kerja jarak jauh, tarikh siaran — dan hantarkannya ke extract_structured. Ia memetakan markup setiap papan kepada bentuk anda, dan berpatah balik kepada pemilih CSS apabila tiada LLM dikonfigurasikan.

04Berapakah kos mengumpul iklan daripada satu papan pekerjaan?

Lebih kurang 8 credits untuk satu halaman papan: 5 untuk pas pelayar scrape_with_actions dan 3 untuk setiap panggilan extract_structured pada sesuatu iklan. Gunakan batch_scrape apabila anda menarik ratusan halaman perincian sehari.

Mula menempa

Sedia untuk Bermula?

Setiap akaun baharu mendapat 1,000 credits percuma. Tiada kad kredit diperlukan.