Pada halaman ini
Tugas pengekstrakan web tidak sepatutnya memerlukan penghantaran data yang anda scrape kepada OpenAI. Dengan extract_with_llm dan pemasangan Ollama setempat, pengekstrakan berstruktur kini berjalan sepenuhnya pada mesin anda -- tiada kunci API, tiada kos setiap token, tiada pihak ketiga melihat kandungan anda. Catatan ini ialah penerokaan mendalam: mengapa setempat itu penting, cara menyediakannya, dan bila hendak menggunakannya berbanding alternatif.
Jadual Kandungan
- Apakah Pengekstrakan Web LLM?
- Mengapa Ollama Setempat (dan Bukan OpenAI)?
- Setup: Ollama + extract_with_llm in 5 Minutes
- list_ollama_models: Discover What Is On Your Machine
- Pengekstrakan Dipacu Skema
- Bila Hendak Menggunakan Ollama lwn OpenAI lwn Anthropic
- Perbandingan Kos
- Batasan dan Ketepatan
Apakah Pengekstrakan Web LLM?
Pengekstrakan web LLM ialah aliran kerja di mana anda menyerahkan dua perkara kepada model -- HTML mentah sesuatu halaman dan skema yang menerangkan apa yang anda mahu -- dan model memulangkan JSON berstruktur. Ia adalah pengganti moden untuk pemilih CSS yang ditulis tangan. Apabila susun atur tapak berubah, pemilih rosak; LLM menyesuaikan diri.
CrawlForge telah mempunyai ini buat seketika sebagai extract_structured (CSS dahulu, sandaran LLM). Alat extract_with_llm baharu ialah LLM dahulu: setiap pengekstrakan ialah panggilan LLM. Apa yang berubah dalam v4.2.2 ialah pembekal lalai. Sebelum ini anda memerlukan kunci OpenAI atau Anthropic. Kini anda tidak memerlukannya.
Mengapa Ollama Setempat (dan Bukan OpenAI)?
Tiga sebab, dalam susunan kepentingan menurun untuk kebanyakan pasukan.
1. Data yang anda scrape kekal pada mesin anda. Apabila anda memanggil OpenAI, kandungan halaman pergi ke OpenAI. Untuk perisikan persaingan, dokumen undang-undang, data pelanggan, atau apa-apa yang dikawal selia, itu selalunya menjadi penghalang besar. Ollama setempat bermaksud localhost sahaja.
2. LLM adalah percuma. Panggilan gpt-4o-mini berkos sekitar $0.0001 setiap pengekstrakan pada skala. Bunyinya seperti tiada apa-apa -- sehingga anda menjalankan 10,000 pengekstrakan sehari. Ollama ialah $0 tambah elektrik. Anda masih membayar 3 CrawlForge credits setiap panggilan tanpa mengira pembekal.
3. Tiada kunci API baharu untuk diurus. Jika anda mempunyai Ollama, anda mempunyai pembekal. Tiada pendaftaran, tiada amaran bil, tiada putaran.
Tukar gantinya ialah kualiti model. llama3.1:8b pada komputer riba tidak akan menandingi gpt-4o pada halaman yang sukar. Untuk kes 80% (HTML bersih, skema mudah), ia memadai. Untuk 20% (diformat dengan banyak, kabur), anda boleh kembali kepada OpenAI atau Anthropic dalam panggilan yang sama.
Setup: Ollama + extract_with_llm in 5 Minutes
# 1. Install Ollama
curl -fsSL https://ollama.com/install.sh | sh
# 2. Pull a model (8B is a good starting point)
ollama pull llama3.1:8b
# 3. Verify it is running
curl http://127.0.0.1:11434/api/tagsItu bahagian Ollama. Kini daripada CrawlForge (melalui CLI, MCP server, atau API -- mana-mana laluan berfungsi):
import { CrawlForge } from 'crawlforge-mcp-server';
const cf = new CrawlForge({ apiKey: process.env.CRAWLFORGE_API_KEY });
const result = await cf.extract_with_llm({
url: 'https://news.ycombinator.com/item?id=39820700',
schema: {
type: 'object',
properties: {
title: { type: 'string' },
points: { type: 'number' },
author: { type: 'string' },
comments_count: { type: 'number' },
},
required: ['title', 'points'],
},
provider: 'ollama',
model: 'llama3.1:8b',
});
console.log(result);
// { title: "Show HN: ...", points: 412, author: "patio11", comments_count: 187 }Daripada CLI:
crawlforge extract https://news.ycombinator.com/item?id=39820700 \
--schema schema.json \
--provider ollama \
--model llama3.1:8blist_ollama_models: Discover What Is On Your Machine
Sebelum menjalankan kelompok besar, periksa kewarasan apa yang sebenarnya dipasang:
crawlforge extract --list-ollama-modelsAtau melalui MCP/SDK:
const models = await cf.list_ollama_models();
// [{ name: 'llama3.1:8b', size: '4.7GB', modified: '2026-05-12' }, ...]Ini berkos 0 credits. Ia adalah pembantu penemuan, bukan panggilan pengekstrakan. Berguna dalam aliran orientasi, ujian asap CI ("adakah Ollama disediakan dengan betul?"), dan sebagai langkah pertama dalam mana-mana saluran paip LLM setempat.
Pengekstrakan Dipacu Skema
Skema ialah objek JSON Schema piawai. LLM membacanya dan menghasilkan output yang sepadan. Dua corak berfungsi dengan baik:
Corak 1: Skema rata untuk data mudah
{
type: 'object',
properties: {
title: { type: 'string' },
price_usd: { type: 'number' },
in_stock: { type: 'boolean' },
},
}Corak 2: Skema bersarang untuk data yang lebih kaya
{
type: 'object',
properties: {
product: {
type: 'object',
properties: {
name: { type: 'string' },
price: {
type: 'object',
properties: {
amount: { type: 'number' },
currency: { type: 'string' },
},
},
},
},
reviews: {
type: 'array',
items: {
type: 'object',
properties: {
author: { type: 'string' },
rating: { type: 'number' },
text: { type: 'string' },
},
},
},
},
}Semakin kecil skema, semakin boleh dipercayai pengekstrakan -- terutamanya pada model 8B setempat. Jika anda mendapati model menghalusinasikan medan, permudahkan.
Bila Hendak Menggunakan Ollama lwn OpenAI lwn Anthropic
| Senario | Pembekal disyorkan | Mengapa |
|---|---|---|
| Pengekstrakan kelompok volum tinggi | Ollama | Kos LLM marginal = $0 |
| Data sensitif atau dikawal selia | Ollama | Localhost sahaja |
| Penaakulan kompleks, pelbagai halaman | OpenAI (gpt-4o) | Penaakulan terbaik pada halaman sukar |
| Konteks panjang (50K+ token) | Anthropic (Claude) | Tetingkap konteks 200K |
| Prototaip pantas, volum rendah | Ollama | Persediaan sifar selepas pemasangan |
| Kandungan kabur (sindiran, slanga) | OpenAI atau Anthropic | Model lebih besar = penyahkaburan lebih baik |
Berita baiknya: menukar pembekal ialah satu perubahan parameter. Anda boleh membuat prototaip pada Ollama, terkena halaman sukar, bertukar kepada provider: "openai" untuk satu panggilan itu, dan teruskan.
Perbandingan Kos
Kos-setiap-1,000-pengekstrakan, dengan andaian halaman purata (~3K token masuk, ~200 token keluar):
| Pembekal | Model | Kos LLM setiap 1K | CrawlForge credits setiap 1K | Jumlah setiap 1K |
|---|---|---|---|---|
| Ollama (setempat) | llama3.1:8b | $0 (elektrik) | 3,000 credits | 3,000 credits |
| Ollama (setempat) | llama3.1:70b | $0 (elektrik, lebih) | 3,000 credits | 3,000 credits |
| OpenAI | gpt-4o-mini | ~$0.45 | 3,000 credits | 3,000 credits + $0.45 |
| OpenAI | gpt-4o | ~$8.50 | 3,000 credits | 3,000 credits + $8.50 |
| Anthropic | claude-haiku-4-5 | ~$0.30 | 3,000 credits | 3,000 credits + $0.30 |
| Anthropic | claude-sonnet-4-6 | ~$4.50 | 3,000 credits | 3,000 credits + $4.50 |
CrawlForge credits adalah tetap merentas pembekal -- anda membayar untuk orkestrasi, bukan model. Pada peringkat Hobby kami (10,000 credits/$19/bulan), itu kira-kira 3,300 pengekstrakan LLM sebulan untuk $19 + $0 (jika anda menggunakan Ollama).
Batasan dan Ketepatan
Apa yang Ollama setempat (llama3.1:8b) lakukan dengan baik dalam penanda aras dalaman kami:
- Halaman produk bersih (Amazon, Shopify): ~95% ketepatan medan
- Metadata artikel (Substack, Medium): ~92%
- Bebenang forum (HN, Reddit): ~88%
Apa yang ia bergelut dengannya:
- Halaman yang banyak dipaparkan dengan JS dengan HTML minimum (gunakan
scrape_with_actionsdahulu, kemudian ekstrak) - Halaman dengan struktur kabur (gunakan model frontier)
- Skema dengan 20+ medan (pecahkan kepada beberapa pengekstrakan)
- Kandungan bukan bahasa Inggeris (gunakan model berbilang bahasa seperti
mistral)
Jika ketepatan adalah kritikal dan Ollama terlepas medan, pembetulannya biasanya: skema lebih mudah, atau naik taraf kepada provider: "openai" untuk panggilan itu.
Bersedia untuk mengekstrak data tanpa meninggalkan mesin anda? Mula percuma dengan 1,000 credits dan cuba extract_with_llm dengan Ollama setempat anda. Baharu dengan CrawlForge? Baca pengumuman pelancaran v4.2.2 untuk konteks, atau panduan CLI untuk aliran kerja terminal dahulu.
Cuba sendiri — tiada pendaftaran diperlukan
Jalankan mana-mana daripada 27 alat scraping dan pengekstrakan CrawlForge dalam playground, kemudian mula secara percuma dengan 1,000 credits.
1,000 credits percuma • Isi semula setiap bulan • Tiada kad kredit diperlukan
Tag
Tentang Penulis
Kekal dikemas kini dengan pandangan terkini
Dapatkan tutorial, kemas kini produk dan petua web scraping terus ke peti masuk anda.
Tiada spam. Berhenti melanggan bila-bila masa.