ARTICLE DETAIL

资讯详情

深耕网站SEO优化与搜索引擎排名提升的一线实战洞察。

Crawl4LLM 快速入门(一):环境搭建与依赖安装完整指南

Crawl4LLM 快速入门(一):环境搭建与依赖安装完整指南 Crawl4LLM 快速入门一环境搭建与依赖安装完整指南【免费下载链接】Crawl4LLMOfficial repository for Craw4LLM: Efficient Web Crawling for LLM Pretraining项目地址: https://gitcode.com/gh_mirrors/cr/Crawl4LLMCrawl4LLM 是一个为大型语言模型LLM预训练而设计的高效网页爬取工具源自论文 Crawl4LLM: Efficient Web Crawling for LLM Pretraining。与传统的广度优先爬虫不同Crawl4LLM 会主动挑选高质量网页让预训练语料的构建效率大幅提升。本文是系列教程第一篇带你从零开始完成 Crawl4LLM 的环境搭建与依赖安装为后续爬取任务打好基础。Crawl4LLM 环境搭建前的准备工作在开始安装之前你需要先了解 Crawl4LLM 的三大前置条件前置条件说明获取方式ClueWeb22 数据集爬虫运行所需的网页语料库向 lemurproject.org 提交申请Python 虚拟环境要求 Python 版本 3.10使用 venv 或 conda 创建DCLM fastText 分类器用于评估网页文本质量从 Hugging Face 下载[!IMPORTANT] 想要高效运行爬虫ClueWeb22 数据最好放在SSD 固态硬盘上机械硬盘的随机读取性能会严重拖慢爬取速度。第一步申请 ClueWeb22 数据集Crawl4LLM 的核心爬取逻辑见 crawler.py依赖 ClueWeb22 数据集。请先前往 lemurproject.org 官网提交申请获批后下载数据。数据目录结构会按语言、segment 等维度组织爬虫通过 corpus_interface.py 中的ClueWeb22Api按文档 ID 读取 HTML 与正文内容。第二步创建 Python 虚拟环境Crawl4LLM 要求Python 3.10 及以上版本建议使用虚拟环境隔离依赖避免污染系统环境python3 -m venv crawl4llm-env source crawl4llm-env/bin/activate激活后终端提示符前会出现(crawl4llm-env)字样说明虚拟环境已生效。第三步克隆 Crawl4LLM 仓库环境就绪后克隆项目代码git clone https://gitcode.com/gh_mirrors/cr/Crawl4LLM cd Crawl4LLMCrawl4LLM 依赖安装的完整步骤核心依赖清单根据项目的 README.md 说明Crawl4LLM 的依赖非常精简只有 5 个核心库依赖包用途numpy数值计算与数据处理tqdm进度条显示爬取过程可视化fasttextDCLM 文本质量分类模型推理pyyaml解析配置文件wandb训练与爬取过程的可视化日志一键安装所有依赖直接通过 pip 安装即可pip install numpy tqdm fasttext pyyaml wandb如果下载速度较慢可以临时切换国内镜像源pip install numpy tqdm fasttext pyyaml wandb -i https://pypi.tuna.tsinghua.edu.cn/simple安装完成后建议验证一下关键包是否可用python -c import fasttext, yaml, wandb, numpy; print(All dependencies OK)若输出All dependencies OK说明依赖安装成功。下载 DCLM fastText 分类器Crawl4LLM 使用 DCLM 的 fastText 模型来评估网页文本质量对应 document_rater.py 中的FasttextRater。请从 Hugging Face 下载fasttext-oh-eli5模型文件并放到项目的fasttext_scorers/目录下mkdir -p fasttext_scorers # 将下载的 openhermes_reddit_eli5_vs_rw_v2_bigram_200k_train.bin # 放入 fasttext_scorers/ 目录该模型文件会在后续配置 Crawl4LLM 评分器时被引用模型路径就写在 YAML 配置的model_path字段中。Crawl4LLM 环境验证跑通第一个爬取任务环境搭建完成后可以通过一个简单的流程验证 Crawl4LLM 是否工作正常。准备种子文档项目自带的 seed.txt 包含了 10000 个 ClueWeb22 种子文档 ID例如clueweb22-en0041-36-03476。爬虫会从这些种子文档出发沿着超链接不断扩展爬取范围。创建配置文件在configs/目录下创建 YAML 配置文件参考 README.md 中的 Crawl4LLM 配置示例cw22_root_path: path_to_clueweb22 seed_docs_file: seed.txt output_dir: crawl_results/seed_10k_crawl_20m_dclm_fasttext num_selected_docs_per_iter: 10000 num_workers: 16 max_num_docs: 20000000 selection_method: dclm_fasttext_score order: desc wandb: false rating_methods: - type: length - type: fasttext_score rater_name: dclm_fasttext_score model_path: fasttext_scorers/openhermes_reddit_eli5_vs_rw_v2_bigram_200k_train.bin启动爬虫配置就绪后运行以下命令启动爬取入口为 crawl.pypython crawl.py crawl --config configs/your_config.yaml爬虫会迭代执行评分 → 弹出高分文档 → 提取外链 → 再次评分的循环每轮迭代的耗时与剩余时间会实时打印在日志中方便你掌握进度。常见问题与排查技巧Python 版本过低怎么办Crawl4LLM 的代码使用了list[Document]等新式类型注解需要 Python 3.10 才能解析。可通过python --version检查版本必要时用 conda 新建高版本环境conda create -n crawl4llm python3.10 conda activate crawl4llmfasttext 安装失败fasttext 需要编译建议先确认系统安装了 gcc 和 g。Windows 用户可直接安装官方预编译版本Linux 用户若编译报错可尝试升级 pip 后重试。不想用 wandb 记录日志在 YAML 配置中把wandb设为false即可关闭日志记录逻辑见 wandb_logger.py不影响爬取功能。下一步开始你的 Crawl4LLM 之旅至此Crawl4LLM 的环境搭建与依赖安装已全部完成。你已经掌握了Python 虚拟环境的创建、5 大核心依赖的安装、DCLM 分类器的下载以及配置文件的编写方法。接下来可以用python access_data.py path_to_clueweb22 document_id浏览单条数据见 access_data.py或在爬取完成后用 fetch_docs.py 提取文档正文为 LLM 预训练准备高质量语料。下一篇教程将深入讲解 Crawl4LLM 的配置项调优与三种基线爬虫随机爬虫、入度爬虫的对比实验敬请期待【免费下载链接】Crawl4LLMOfficial repository for Craw4LLM: Efficient Web Crawling for LLM Pretraining项目地址: https://gitcode.com/gh_mirrors/cr/Crawl4LLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表