Pada halaman ini
Separuh daripada permintaan scraping yang kami lihat di CrawlForge ialah sepuluh laman yang sama: Amazon, LinkedIn, GitHub, YouTube, Reddit, Hacker News, Stack Overflow, npm, Product Hunt dan Twitter/X. Kami bosan melihat orang menulis pemilih CSS yang sama berulang kali -- dan melihat pemilih itu rosak pada kali seterusnya laman tersebut mengemas kini reka letaknya. Jadi kami buat kerja itu sekali sahaja, membungkusnya sebagai scrape_template, dan kini anda membayar 1 credit dan mendapat JSON berstruktur.
Isi Kandungan
- Apakah scrape_template?
- 10 Laman yang Disokong
- Mula Pantas: Scrape Produk Amazon
- Profil LinkedIn (Dengan Nota Undang-undang)
- Repo GitHub untuk Data Latihan AI
- Tujuh Templat Yang Lain
- scrape_template vs scrape_structured vs extract_with_llm
- Batasan
Apakah scrape_template?
scrape_template ialah satu alat CrawlForge dengan sepuluh skema laman prabina. Anda pilih templat, hantar URL, dan dapatkan kembali JSON berstruktur yang sepadan dengan bentuk semula jadi laman tersebut. Tiada pemilih CSS. Tiada penghuraian HTML. Tiada definisi skema.
Tukar gantinya: anda hanya mendapat sepuluh laman yang kami selenggara. Jika anda perlukan sesuatu yang lain, gunakan scrape_structured (mengutamakan CSS) atau extract_with_llm (mengutamakan LLM). Untuk permintaan jangka panjang seperti "Saya mahukan data produk dari Amazon", scrape_template ialah laluan terpendek. Perlukan aliran kerja berbilang langkah dan bukannya satu laman? Lihat cara menggunakan galeri templat.
Ia berkos 1 credit setiap scrape -- sama seperti fetch_url asas -- kerana kami sudah pun menyelesaikan kerja skema di hulu.
10 Laman yang Disokong
| Templat | Memulangkan | Terbaik untuk | Corak URL contoh |
|---|---|---|---|
amazon-product | Tajuk, harga, penilaian, kiraan ulasan, imej, ASIN, ketersediaan | Pemantauan harga, penyelidikan produk | /dp/<ASIN> |
linkedin-profile | Nama, tajuk utama, lokasi, tentang, syarikat semasa | Pengayaan prospek | /in/<handle> |
github-repo | Bintang, fork, bahasa, topik, lesen, kemas kini terakhir | Analisis repo, data latihan AI | /<owner>/<repo> |
youtube-video | Tajuk, saluran, tontonan, tempoh, diterbitkan, perihalan | Penyelidikan kandungan | /watch?v=<id> |
reddit-thread | Tajuk siaran, skor, pengarang, subreddit, badan | Isyarat komuniti | /r/<sub>/comments/<id> |
hacker-news-front-page | Cerita muka depan: tajuk, URL, skor, pengarang, komen | Penjejakan trend teknologi | news.ycombinator.com |
stackoverflow-question | Soalan, jawapan diterima, kiraan undi, tag | Perlombongan Soal Jawab pembangun | /questions/<id> |
npm-package | Metadata pakej, muat turun mingguan, versi, penyelenggara | Analisis kebergantungan | /package/<name> |
producthunt-launch | Produk, slogan, undi naik, topik, laman web | Pemantauan pelancaran | /posts/<slug> |
tweet | Teks, pengarang, URL, imej | Pendengaran sosial | /<user>/status/<id> |
Mula Pantas: Scrape Produk Amazon
crawlforge template amazon-product "https://www.amazon.com/dp/B0CHX1W1XY"Output:
{
"asin": "B0CHX1W1XY",
"title": "Logitech MX Master 3S Wireless Performance Mouse",
"price": { "amount": 99.99, "currency": "USD" },
"rating": 4.7,
"review_count": 12483,
"in_stock": true,
"images": ["https://m.media-amazon.com/...", "..."],
"credits_used": 1
}Daripada klien MCP seperti Claude Code:
"Gunakan scrape_template dengan templat amazon untuk mendapatkan harga dan penilaian semasa bagi ASIN B0CHX1W1XY."
Claude memilih alat, memformat panggilan, dan memulangkan data. Satu credit.
Profil LinkedIn (Dengan Nota Undang-undang)
crawlforge template linkedin-profile "https://www.linkedin.com/in/satyanadella"Output:
{
"name": "Satya Nadella",
"headline": "Chairman and CEO at Microsoft",
"location": "Redmond, Washington",
"current_role": { "title": "CEO", "company": "Microsoft", "since": "2014-02" },
"experience_count": 6,
"skills_top": ["Leadership", "Strategy", "Cloud Computing"],
"credits_used": 1
}Satu nota tentang scraping LinkedIn. Terma perkhidmatan LinkedIn menyekat akses automatik. Kes hiQ Labs v. LinkedIn (Litar ke-9, 2022) menetapkan bahawa scraping data profil awam pada amnya dibenarkan, tetapi penggunaan komersial, scraping yang memerlukan log masuk, dan kekerapan yang agresif masih boleh mencetuskan tindakan undang-undang dan larangan ToS. Gunakan
scrape_templatedengan templatlinkedin-profileuntuk data awam, berkekerapan rendah, dan tidak dijual semula sahaja.
Repo GitHub untuk Data Latihan AI
crawlforge template github-repo "https://github.com/anthropics/anthropic-sdk-python"Output:
{
"owner": "anthropics",
"name": "anthropic-sdk-python",
"stars": 1842,
"forks": 287,
"primary_language": "Python",
"languages": { "Python": 98.4, "Makefile": 1.6 },
"license": "MIT",
"topics": ["claude", "anthropic", "sdk"],
"readme_markdown": "# Anthropic Python SDK...",
"last_commit_at": "2026-05-19T14:22:11Z",
"credits_used": 1
}Templat ini banyak digunakan untuk talian paip data latihan AI -- menarik README secara berskala merentas beribu-ribu repo. Gandingkannya dengan batch_scrape untuk memproses CSV URL repo.
Tujuh Templat Yang Lain
YouTube -- tajuk, saluran, tontonan, transkrip penuh apabila tersedia:
crawlforge template youtube-video "https://www.youtube.com/watch?v=dQw4w9WgXcQ"Reddit -- siaran + pokok komen:
crawlforge template reddit-thread "https://www.reddit.com/r/programming/comments/<id>"Hacker News -- muka depan sebagai senarai cerita:
crawlforge template hacker-news-front-page "https://news.ycombinator.com"
# memulangkan sehingga 30 cerita muka depan; hiris 10 teratas dengan jq:
crawlforge template hacker-news-front-page "https://news.ycombinator.com" --json | jq '.stories[:10]'Stack Overflow -- soalan, jawapan diterima, alternatif teratas:
crawlforge template stackoverflow-question "https://stackoverflow.com/questions/12345678"npm -- metadata pakej + muat turun mingguan:
crawlforge template npm-package "https://www.npmjs.com/package/next"Product Hunt -- produk, pembuat, undi naik:
crawlforge template producthunt-launch "https://www.producthunt.com/posts/crawlforge"Twitter/X -- satu tweet dengan penglibatan dan balasan:
crawlforge template tweet "https://x.com/elonmusk/status/<id>"Semuanya memulangkan JSON. Semuanya berkos 1 credit. Semuanya diselenggara secara berpusat -- apabila LinkedIn atau Amazon mengemas kini reka letak mereka, kami mengemas kini templat.
scrape_template vs scrape_structured vs extract_with_llm
Pokok keputusan:
Is your target one of the 10 supported sites?
Yes -> use scrape_template (1 credit, maintained for you)
No
Do you know the CSS selectors and are they stable?
Yes -> use scrape_structured (2 credits, you maintain selectors)
No -> use extract_with_llm (3 credits, schema-based, layout-resilient)
Perbandingan pantas:
| scrape_template | scrape_structured | extract_with_llm | |
|---|---|---|---|
| Credits | 1 | 2 | 3 |
| Liputan | 10 laman tertentu | Mana-mana laman yang anda boleh tulis pemilih untuknya | Mana-mana laman |
| Penyelenggaraan | Kami selenggara | Anda selenggara | LLM menyesuaikan diri |
| Kelajuan | Pantas (skema dicache) | Pantas | Lebih perlahan (panggilan LLM) |
| Terbaik untuk | Laman popular, volum tinggi | Struktur tertentu yang diketahui | Struktur yang tidak diketahui atau berubah |
Batasan
- Hanya 10 laman. Jika anda perlukan Etsy, eBay, TikTok, atau yang lain, anda sedang menunggu peta jalan atau membina sendiri dengan
scrape_structured/extract_with_llm. Minta templat di Discord. - Data awam sahaja. Tiada templat memerlukan log masuk. Profil yang ditetapkan sebagai peribadi, repo berpagar, dan tweet yang dilindungi hanya akan memulangkan apa yang kelihatan secara awam sahaja.
- Perubahan reka letak berlaku. Apabila sesebuah laman melancarkan reka bentuk semula, kami biasanya menampal templat dalam masa 24 jam.
- Had kadar dikenakan. Scraping LinkedIn atau Amazon bervolum tinggi harus menggandingkan
scrape_templatedenganstealth_mode(5 credits) dan menghormati robots.txt setiap laman.
Sedia untuk melangkau pemilih? Mula percuma dengan 1,000 credits -- cukup untuk 1,000 scrape templat. Baru di sini? Baca siaran pelancaran v4.2.2 untuk konteks, atau panduan pengekstrakan e-dagang untuk aliran kerja dunia sebenar yang dibina sekitar templat ini.
Cuba sendiri — tiada pendaftaran diperlukan
Jalankan mana-mana daripada 27 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.
1,000 credits percuma • Isi semula setiap bulan • Tiada kad kredit diperlukan
Tag
Tentang Penulis
Kekal dikemas kini dengan pandangan terkini
Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.
Tiada spam. Berhenti melanggan bila-bila masa.