Pada halaman ini
Kebanyakan alat penyelidikan kata kunci menjawab soalan yang salah. Ia memberitahu anda betapa sukarnya sesuatu istilah pada skala 1 hingga 100, iaitu ringkasan bagi sebuah ringkasan. Apa yang anda sebenarnya perlu tahu ialah siapa yang menduduki sepuluh teratas dan jenis halaman apakah ia, kerana itu menentukan sama ada kedudukan itu boleh dirampas atau tidak.
Panduan ini membina analisis tersebut sebagai satu saluran paip boleh dihasilkan semula di atas sambungan MCP. Ini kaedah tepat di sebalik kajian SERP web scraping 2026 kami, termasuk kesilapan yang membatalkan kebanyakan penyelidikan kata kunci buat sendiri.
Kandungan
- Tiga peringkat
- Kesilapan yang menjadikan kebanyakan penyelidikan kata kunci fiksyen
- Peringkat 1: Temui istilah calon
- Peringkat 2: Tarik kedudukan organik sebenar
- Peringkat 3: Kelaskan jenis halaman
- Memberi skor kepada jurang
- Memeriksa niat sebelum anda komited
- Kos credits dan masa larian
- Menjalankannya daripada API REST
- Soalan lazim
Tiga peringkat
| Peringkat | Tool | Credits | Menjawab |
|---|---|---|---|
| Temui | search_web | 5 | Istilah mana yang wujud dan siapa yang muncul |
| Ukur | serp_rank | 5 | Sepuluh teratas organik yang sebenar |
| Kelaskan | analyze_content (pilihan) | 3 | Jenis halaman bagi setiap keputusan |
Peringkat 3 biasanya pertimbangan manusia dan bukan panggilan tool — anda melabel sembilan URL, dan itu lebih pantas dilakukan dengan mata berbanding melalui API.
Kesilapan yang menjadikan kebanyakan penyelidikan kata kunci fiksyen
Mulakan di sini, kerana ia membatalkan segala yang datang selepasnya.
Susunan keputusan sesuatu API carian bukanlah kedudukan Google. Alat carian mengambil keputusan kemudian menyusunnya semula. search_web milik CrawlForge menyusun semula apa yang diambilnya menggunakan pemberat BM25, keserupaan semantik, autoriti dan kesegaran, dan ia melaporkan perkara itu dengan tepat dalam responsnya:
{
"processing": {
"ranking": {
"algorithmsUsed": ["bm25", "semantic", "authority", "freshness"],
"weightsApplied": { "bm25": 0.4, "semantic": 0.3, "authority": 0.2, "freshness": 0.1 }
}
}
}Penyusunan semula itu menjadikan keputusan lebih baik untuk penyelidikan dan tidak berguna sebagai ukuran kedudukan. Jika anda membaca kedudukan 1 daripada sesuatu API carian dan merekodkannya sebagai kedudukan Google, setiap kesimpulan yang dibina di atasnya adalah salah.
Gunakan search_web untuk mengetahui domain mana yang sedang bermain. Gunakan serp_rank — yang memulangkan nilai rank_group Google sendiri — untuk apa-apa yang anda berhasrat menyebutnya sebagai kedudukan.
Peringkat 1: Temui istilah calon
Buka skop seluas mungkin dahulu. Anda sedang mencari perbendaharaan kata kategori ini, belum lagi kedudukan.
import { Client } from '@modelcontextprotocol/sdk/client/index.js';
const client = new Client({ name: 'keyword-gap', version: '1.0.0' });
interface Candidate {
keyword: string;
indexedPages: number;
domains: string[];
}
async function discover(keyword: string): Promise<Candidate> {
const res = await client.callTool({
name: 'search_web',
arguments: { query: keyword, limit: 20 },
});
const data = JSON.parse(res.content[0].text);
return {
keyword,
// Google's rough index estimate -- a crowding signal, NOT search volume.
indexedPages: parseInt(data.total_results ?? '0', 10),
// Presence only. This order is re-ranked and is not a Google ranking.
domains: [...new Set(data.results.map((r) => r.displayLink))],
};
}Dua medan yang penting. total_results ialah kiraan anggaran Google bagi halaman yang bersaing — satu isyarat kesesakan, bukan volum. Senarai domain memberitahu anda siapa yang berada dalam perbualan itu.
Peringkat 2: Tarik kedudukan organik sebenar
Kini ukur. serp_rank menjalankan pertanyaan Google secara langsung dan memulangkan kedudukan organik sebenar, berserta senarai pesaing.
interface RankResult {
keyword: string;
found: boolean;
position: number | null;
competitors: Array<{ position: number; domain: string; url: string }>;
}
async function measure(keyword: string, target: string): Promise<RankResult> {
const res = await client.callTool({
name: 'serp_rank',
arguments: {
keyword,
target,
location_name: 'United States',
device: 'desktop',
depth: 10,
},
});
const data = JSON.parse(res.content[0].text);
// Unconfigured deployments return configured:false rather than a fake rank.
if (data.configured === false) {
throw new Error('serp_rank is not configured on this server');
}
return {
keyword,
found: data.found,
position: data.position,
competitors: (data.results ?? []).map((r) => ({
position: r.position,
domain: r.domain,
url: r.url,
})),
};
}Jalankan ini secara berjujukan, bukan selari. Endpoint SERP langsung menjalankan pertanyaan Google masa nyata; melepaskan beberapa serentak menghasilkan tamat masa secara konsisten, bukan keputusan yang lebih pantas.
depth: 10 ialah nilai lalai yang betul. Imbasan lebih dalam memakan kos lebih tinggi dan, bagi analisis jurang, kedudukan 11 ke atas jarang mengubah keputusan.
Peringkat 3: Kelaskan jenis halaman
Inilah peringkat yang menghasilkan pandangan sebenar, dan ia kebanyakannya pertimbangan.
Bagi setiap sembilan atau sepuluh keputusan, labelkan jenis halamannya:
- Komersial — laman utama, halaman produk, halaman harga
- Kandungan vendor — catatan blog atau dokumentasi sesebuah syarikat
- Bebas — direktori, utas forum, repositori kod, artikel berita
Kemudian kira keputusan komersial. Satu nombor itu memberitahu anda lebih banyak daripada mana-mana skor kesukaran:
type PageType = 'commercial' | 'vendor-content' | 'independent';
function gapScore(labels: PageType[]): 'closed' | 'contested' | 'open' {
const commercial = labels.filter((l) => l === 'commercial').length;
if (commercial >= 4) return 'closed';
if (commercial >= 1) return 'contested';
return 'open';
}Diterapkan pada data sebenar daripada kajian kami:
| Kata kunci | Keputusan komersial | Keputusan penilaian |
|---|---|---|
| web scraping api | 6 daripada 9 | tertutup |
| firecrawl alternative | 2 daripada 9 | diperebutkan |
| mcp scraping | 0 daripada 8 | terbuka |
"web scraping api" tertutup — enam laman utama dan halaman produk vendor, setiap satunya disokong bertahun-tahun pembinaan pautan. Tiada jumlah kualiti kandungan yang mampu menggerakkannya.
"firecrawl alternative" berada di tengah. Hanya dua keputusan ialah halaman pendaratan komersial, iaitu halaman alternatif Apify dan sebuah halaman perbandingan Context, tetapi selebihnya padat dengan catatan blog vendor yang semuanya mengejar pelanggan yang sama-sama sedang beralih. Boleh dimenangi, sesak, dan berbaloi diusahakan hanya jika anda mempunyai sesuatu yang spesifik untuk dikatakan.
"mcp scraping" mendapat penilaian terbuka, dan komposisinya menjelaskan sebabnya: dua direktori, satu utas Reddit, satu repositori GitHub, tiga blog pihak ketiga dan satu halaman dokumentasi. Tiada sesiapa menerbitkan halaman komersial untuknya.
Memberi skor kepada jurang
Gabungkan dua isyarat itu. Sesuatu istilah berbaloi dikejar apabila SERP terbuka dan kesesakannya boleh diuruskan:
interface Scored {
keyword: string;
verdict: 'closed' | 'contested' | 'open';
indexedPages: number;
priority: 'high' | 'medium' | 'skip';
}
function prioritise(c: Candidate, verdict: Scored['verdict']): Scored['priority'] {
if (verdict === 'closed') return 'skip';
if (verdict === 'open' && c.indexedPages < 2_000_000) return 'high';
return 'medium';
}Ambang itu satu pertimbangan, bukan hukum. Susunannya yang penting: SERP terbuka dengan kesesakan sederhana sentiasa mengalahkan SERP diperebutkan dengan kesesakan rendah.
Memeriksa niat sebelum anda komited
Satu pintu terakhir, dan ia tidak boleh diautomasikan.
Baca tajuk sepuluh teratas dan tanya sama ada pencari itu mahu membeli apa yang anda jual. Dalam kajian kami, "llm scraper" lulus setiap penapis berangka — 329,000 halaman bersaing, jelas berkaitan topik — dan gagal apabila bersentuhan dengan keputusan sebenar. Sebahagian besarnya ialah orang yang cuba menyekat scraper: satu utas YunoHost bertajuk "Prevent LLM scrapers/trawlers?", satu utas r/sysadmin tentang melawannya, Akamai tentang pengurusan bot.
Perkataan yang sama, niat yang bertentangan. Mendapat kedudukan di situ memberi anda trafik yang tidak pernah menukar dan kadar lantunan yang mengajar Google bahawa halaman anda jawapan yang buruk.
Tiga puluh saat membaca menangkap apa yang tiada skor mampu tangkap.
Kos credits dan masa larian
Satu kajian sepuluh kata kunci:
| Perkara | Panggilan | Credits |
|---|---|---|
| Penemuan | 10 x search_web | 50 |
| Pengukuran | 10 x serp_rank | 50 |
| Jumlah | 100 |
Itu satu persepuluh daripada 1,000 credits sekali guna pelan Free.
Masa larian ialah kekangan sebenar. Pertanyaan SERP langsung mengambil masa antara 10 hingga 41 saat setiap satu dalam pengukuran kami — kata kunci yang sama berubah dari 11s ke 28s antara larian berturut-turut, kerana endpoint itu menjalankan pertanyaan Google secara langsung yang kependamannya bergantung kepada kapasiti huluan. Sepuluh kata kunci dijalankan berjujukan mengambil masa lima hingga sepuluh minit. Tetapkan tamat masa klien sekurang-kurangnya 60 saat dan jalankan kerja itu di latar belakang.
Menjalankannya daripada API REST
Jika anda tidak berada dalam klien MCP, pertanyaan yang sama berfungsi melalui HTTP:
curl -X POST https://www.crawlforge.dev/api/v1/tools/serp_rank \
-H "X-API-Key: $CRAWLFORGE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"keyword": "mcp scraping",
"target": "crawlforge.dev",
"location_name": "United States",
"depth": 10
}'Respons REST menggunakan rank dan all_positions di tempat tool MCP memulangkan position; kedua-duanya melaporkan kedudukan organik Google yang sama di sebaliknya. Pertanyaan yang gagal — penyedia tidak dapat dihubungi, tamat masa — memulangkan ralat dan tidak dicaj.
Ke mana selepas ini
Setelah anda tahu istilah mana yang terbuka, kerja susulan bersifat teknikal: memastikan halaman yang anda terbitkan untuknya benar-benar boleh dirangkak dan ditanda dengan betul. Panduan kami tentang mengautomasikan audit SEO dengan CrawlForge merangkumi separuh yang itu, dan rujukan API serp_rank mendokumentasikan setiap parameter yang digunakan di atas.
Mula percuma dengan 1,000 credits — cukup untuk kira-kira 200 semakan kedudukan.
Cuba sendiri — tiada pendaftaran diperlukan
Jalankan mana-mana daripada 28 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.
1,000 credits percuma • Sekali sahaja • Tiada kad kredit diperlukan
Tag
Tentang Penulis
Kekal dikemas kini dengan pandangan terkini
Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.
Tiada spam. Berhenti melanggan bila-bila masa.