Pada halaman ini
Cari MCP server carian web yang self-hosted dan hasilnya terbahagi kepada dua kumpulan: projek GitHub yang anda jalankan sepenuhnya sendiri, dan halaman vendor yang memanggil API terhos sebagai "setempat" semata-mata kerana kliennya berjalan pada komputer riba anda. Kedua-duanya perkara berbeza, dan yang mana satu anda perlukan bergantung pada apa yang sebenarnya ingin anda simpan sendiri.
Catatan ini khusus tentang di mana kedudukan CrawlForge pada garis itu — termasuk bahagian yang bukan self-hosted.
Apa maksud "self-hosted" bagi sebuah MCP server
Susunan carian web dengan MCP mempunyai tiga lapisan, dan setiap satunya boleh dihoskan secara berasingan:
- Proses pelayan — benda yang dilancarkan oleh klien MCP anda dan dihubungi melalui stdio.
- Backend carian — yang benar-benar menjawab pertanyaan itu.
- Satah kawalan — pengesahan, pengiraan penggunaan, pengebilan.
Kebanyakan dakwaan "self-hosted" hanya merangkumi lapisan 1. Menjalankan satu proses secara setempat itu perkara asas; hampir setiap MCP server melakukannya. Soalan yang menentukan sama ada ia dikira self-hosted dari sudut privasi ialah lapisan 2: adakah pertanyaan anda keluar dari rangkaian anda, dan siapa yang melihatnya?
Berapa banyak CrawlForge yang berjalan pada mesin anda
Lapisan 1 sepenuhnya milik anda. crawlforge-mcp-server ialah pakej npm berlesen MIT yang berjalan sebagai proses setempat melalui stdio — tiada daemon vendor, tiada runtime awan, dan kodnya ada di GitHub jika anda mahu membacanya sebelum menjalankannya.
npm install -g crawlforge-mcp-serverLapisan 2 yang lebih menarik. search_web menerima parameter provider dengan dua nilai yang diterima, dan salah satunya ialah instance SearXNG anda sendiri:
export CRAWLFORGE_SEARXNG_URL=http://localhost:8888{
"query": "mcp server directory",
"provider": "searxng",
"limit": 10
}Dengan tetapan itu, pertanyaan pergi ke mesin SearXNG anda dan tidak ke mana-mana lagi — tiada vendor carian pihak ketiga yang melihat teks pertanyaan itu. Hasilnya dikembalikan dalam bentuk yang sama seperti provider terhos, jadi penyusunan, penyingkiran pendua dan cache masih berfungsi dan tiada apa-apa berubah di bahagian hiliran aliran kerja anda.
Tools berasaskan LLM mengikut corak yang sama. extract_with_llm, summarize_content dan analyze_content menggunakan model Ollama setempat secara lalai, jadi langkah pengekstrakan juga boleh kekal pada perkakasan anda.
Apa yang bukan self-hosted
Lapisan 3. Pengiraan penggunaan tetap melalui CrawlForge tidak kira provider mana yang anda pilih.
search_web dibalut dengan pemeriksaan pengesahan dan credits yang sama seperti setiap tool lain, dan pemeriksaan itu tidak tahu — dan tidak peduli — bahawa anda memilih SearXNG. Carian yang dilayan oleh SearXNG masih memerlukan API key yang sah dan masih berharga 5 credits, sama seperti carian terhos.
Eloklah dinyatakan dengan jelas apa yang anda dapat dan tidak dapat daripadanya. Menghoskan sendiri backend carian mengubah siapa yang melihat pertanyaan anda — satu keuntungan privasi yang nyata, dan itulah sebab biasa orang mahukannya. Ia tidak menjadikan tool ini percuma, dan ia tidak menghapuskan kebergantungan kepada vendor. Jika syarat anda ialah "tiada sambungan keluar kepada mana-mana vendor", CrawlForge tidak memenuhinya buat masa ini.
Bila pelayan yang sepenuhnya self-hosted itu pilihan yang betul
Jika lapisan 3 ialah bahagian yang anda perlu miliki — rangkaian terasing, tiada akaun vendor, tiada kos setiap panggilan — gunakan projek yang sepenuhnya self-hosted. SearXNG mempunyai wrapper MCP yang bercakap terus dengannya, dan untuk keperluan itu ia lebih sesuai daripada memintas-mintas sebuah tool yang dikira penggunaannya.
CrawlForge berbaloi apabila anda mahu backend carian kekal setempat tetapi masih mahu satu pelayan meliputi kerja yang selebihnya: scrape, extract_content, crawl_deep, serp_rank dan 23 tools lagi atas sambungan yang sama dan key yang sama. Mencari melalui instance anda sendiri dan mengekstrak dengan Ollama anda sendiri, sementara laluan terhos menguruskan halaman yang hanya ditunjukkan oleh SearXNG, ialah jalan tengah yang munasabah — dan pada praktiknya itulah konfigurasi yang akhirnya dikehendaki oleh kebanyakan orang yang mencari perkara ini.
Dapatkan API key — 1,000 credits sekali sahaja, tanpa kad. Tetapkan CRAWLFORGE_SEARXNG_URL, hantar provider: "searxng", dan pertanyaan anda kekal dalam rangkaian anda.
Cuba sendiri — tiada pendaftaran diperlukan
Jalankan mana-mana daripada 29 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.
1,000 credits percuma • Sekali sahaja • Tiada kad kredit diperlukan
Tag
Tentang Penulis
Kekal dikemas kini dengan pandangan terkini
Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.
Tiada spam. Berhenti melanggan bila-bila masa.