第一篇:预训练模型——站在巨人的肩膀上
第一篇预训练模型——站在巨人的肩膀上开篇在正式开始学习 Transformer 之前我们首先要回答一个根本问题我们说的模型到底是什么如果你曾经听说过BERT“GPT”T5这些名字你可能会困惑——它们之间有什么区别为什么有的能做分类有的能写文章有的还能翻译而这一切的起点都指向同一个概念预训练模型Pre-trained Model。什么是预训练模型传统的机器学习做法是针对每个新任务收集大量标注数据从零开始训练一个模型。这就像每次做菜都要从种菜开始——耗时耗力而且小数据集很难训练出好模型。预训练模型改变了这一切。它的思路是先在大规模通用数据上自学一遍掌握语言的基础知识然后再针对特定任务做微调Fine-tuning。传统做法 收集数据 → 从零训练 → 得到模型 预训练做法 加载预训练模型 → 少量数据微调 → 得到模型前者需要海量数据和大量算力后者只需要在预训练模型的基础上做最后一公里的调整。这就好比你已经读完了万卷书预训练现在只需要看几页资料就能回答特定问题微调。常见的预训练模型家族BERT 系列编码器 - bert-base-chinese中文场景的首选按字切分 - bert-base-uncased英文场景不区分大小写 - 擅长分类、命名实体识别、问答 GPT 系列解码器 - gpt2文本生成的开创者 - 擅长续写、对话、创作 T5 系列编码器-解码器 - t5-small统一框架所有任务都转成文本到文本 - 擅长翻译、摘要、分类一切皆生成为什么需要理解内部原理你可能会想“我用AutoModel.from_pretrained()一行代码就能加载模型为什么还要学内部原理”答案在于你不会开车也能开车但出了故障你只能拖去修理厂。理解原理的人能调参、能改进、能诊断问题。具体来说理解 Transformer 的内部机制能帮你诊断问题模型为什么在这个任务上表现差是分词问题位置编码问题还是注意力机制没学到关键模式选择模型BERT 适合分类GPT 适合生成T5 适合序列到序列任务——知道原理才能选对工具。调试代码当last_hidden_state的形状和你预期不符时你知道问题出在哪个环节。深入进阶LoRA、Prompt Tuning、Chain-of-Thought 等高级技术都建立在对 Transformer 基础机制的理解之上。预训练 微调的工作流程一个典型的预训练模型使用流程包含三步fromtransformersimportAutoTokenizer,AutoModel# 第一步加载分词器把文字变成数字tokenizerAutoTokenizer.from_pretrained(bert-base-chinese)# 第二步加载预训练模型加载已经学好的知识modelAutoModel.from_pretrained(bert-base-chinese)# 第三步推理让知识流动起来text我喜欢人工智能inputstokenizer(text,return_tensorspt)outputsmodel(**inputs)这三行代码背后发生了极其复杂的计算。接下来的 9 篇文章将逐层拆解这三行代码背后的每一个步骤。本篇小结预训练模型是在大规模数据上预先训练好的模型可以开箱即用或微调后用主流模型分为 BERT编码器、GPT解码器、T5编码器-解码器三大类理解 Transformer 内部原理是进阶大模型技术的必经之路使用流程异常简洁加载分词器 → 加载模型 → 推理下篇预告你输入的文字是如何变成模型能理解的数字的下一篇我们将打开分词器的黑盒看看我喜欢人工智能是如何变成一串数字的。

相关新闻

Mind+图形化编程集成ollama本地大模型:从部署到AI扩展库实战

Mind+图形化编程集成ollama本地大模型:从部署到AI扩展库实战

1. 项目缘起:当图形化编程遇上本地大语言模型 最近在折腾一个给小朋友做的互动项目,想在里面加点智能对话的功能。一开始想图省事,直接调个在线API,但转念一想,这玩意儿要是以后想离线用,或者网络不好&…

2026/7/29 3:02:25阅读更多 →
EKF+BP混合算法在状态估计中的优化实践

EKF+BP混合算法在状态估计中的优化实践

1. 项目概述:状态估计与智能滤波的融合探索在工业控制、自动驾驶和机器人导航等领域,状态估计始终是核心问题之一。传统滤波算法如扩展卡尔曼滤波(EKF)和粒子滤波(PF)虽然成熟,但在非线性系统中…

2026/7/29 3:02:25阅读更多 →
Arduino Nano实现3D线框渲染:从定点数运算到OLED显示优化

Arduino Nano实现3D线框渲染:从定点数运算到OLED显示优化

1. 项目概述:当3D渲染遇上微控制器最近在整理工作室的物料,翻出来几块闲置的Arduino Nano和0.96寸的OLED12864屏幕。看着这些硬件,一个念头冒了出来:能不能用这点“寒酸”的配置,跑一个最简单的3D线框渲染引擎&#xf…

2026/7/29 3:02:25阅读更多 →
[特殊字符] 2026 上半年十大攻击事件深度复盘:从零日漏洞到数据擦除,安全团队正在经历的噩梦

[特殊字符] 2026 上半年十大攻击事件深度复盘:从零日漏洞到数据擦除,安全团队正在经历的噩梦

微软一个月修了 208 个漏洞,Cisco SD-WAN 一年被曝 7 个零日,医疗巨头被数据擦除攻击瘫痪三周——2026 年上半年的安全形势,比你想象的更严峻。你好,我是老张。2026 年上半年已经过去。这六个月里,网络安全领域发生了一…

2026/7/29 4:31:10阅读更多 →
Altium Designer系统参数设置指南:从基础配置到智能车PCB设计实战

Altium Designer系统参数设置指南:从基础配置到智能车PCB设计实战

1. 项目概述:从零到一,构建智能车竞赛的硬件基石如果你正在备战全国大学生智能车竞赛,或者任何需要一块稳定、高性能PCB的嵌入式项目,那么“AD软件系统参数的一些基本设置”这个看似基础的话题,可能就是决定你作品成败…

2026/7/29 4:31:10阅读更多 →
前端加密实战:cryptoJs核心功能与应用详解

前端加密实战:cryptoJs核心功能与应用详解

1. cryptoJs核心功能解析cryptoJs是前端领域最常用的加密库之一,它实现了多种主流加密算法,包括AES、DES、TripleDES、Rabbit、RC4、MD5、SHA-1、SHA-256等。这个库之所以在前端开发中广受欢迎,主要因为它解决了浏览器环境下的几个关键问题&a…

2026/7/29 4:31:10阅读更多 →
STM32 DMA双缓冲模式原理与HAL库实战:解决高速数据流采集难题

STM32 DMA双缓冲模式原理与HAL库实战:解决高速数据流采集难题

1. 从“搬运工”到“流水线”:DMA双缓冲模式的场景价值如果你用过STM32的DMA,大概率会觉得它是个省心的“搬运工”。你告诉它源地址、目标地址和搬运数量,它就能在后台默默地把数据从外设(比如ADC、串口)搬到内存&…

2026/7/29 4:31:10阅读更多 →
Arduino PWM调光台实战:从电位器到LED的模拟信号控制

Arduino PWM调光台实战:从电位器到LED的模拟信号控制

1. 项目概述:从零打造一个交互式彩灯调光台如果你手头有一块Arduino开发板、几个LED灯和几个电位器,是不是总觉得只能做些流水灯或者简单的呼吸灯?今天这个项目,就是带你把这些简单的元件组合起来,做成一个真正有“台”…

2026/7/29 4:31:10阅读更多 →
Qt文件元数据操作:QFileInfo核心功能与跨平台实践指南

Qt文件元数据操作:QFileInfo核心功能与跨平台实践指南

1. 项目概述:为什么我们需要QFileInfo? 在Qt开发中,处理文件是家常便饭。无论是读取配置文件、加载用户上传的图片,还是管理本地缓存,我们都需要和文件系统打交道。很多时候,我们需要的不仅仅是打开一个文件…

2026/7/29 4:29:09阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/28 4:06:39阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/28 2:08:06阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/28 1:38:28阅读更多 →
28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“! 在构建复杂的 Agent 系统时,我们经常会遇到这样的场景:Agent 正在执行一个多步骤的任务,比如“下单购买商品”,但执行到一半时,我们…

2026/7/29 0:01:46阅读更多 →
自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

近日,国际专注开放式技术研发的声学品牌Nank南卡,正式官宣实力艺人曾舜晞担任品牌代言人。消息一经发出便轰动全网。为什么耳机品牌不选择流量明星、老牌歌手?而且是选择曾舜晞?让我们一起来探索一下!比起短期的流量&a…

2026/7/29 0:01:46阅读更多 →
【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:01:46阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/28 20:22:24阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/29 4:31:51阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/28 2:35:58阅读更多 →