模型的调参,超参数的优化
9.1模型的调参选取一个好的超参数得到一个好的结果是比较花时间的过程1一般会从一个好的基线开始。基线是什么选一个质量比较高的工具包其中设了不错的参数虽然可能对我们的问题不算是最好 的但是是一个不错的开始点如果要做的东西是跟某些论文相关可以看看该论文里面的超参数是什么有些超参数 跟特定的数据集有关这些超参数在一般的情况下都不错有了比较好的起始点之后调整超参数后再重新训练模型再去看看验证集上的结果精度、损失2一次调一个值多个值同时调可能会不知道谁在起贡献看看模型对超参数的敏感度是什么样子没调好一个超参数模型可能会比较差但是调好了也只是到了还不错的范围想对超参数没那么敏感的话可以使用比较好的模型【在优化算法中使用Adam(对有些超参数没那么敏感调参会简单很多)而不是SGD在比较小的区域比较好】实验管理的注意事项每次调参一定要做好笔记训练日志、超参数记录下来这样可以与之前的实验做比较也好做分享与自己重复自己的实验最简单的做法是将log记录到txt上把超参数和关键性指标训练误差放在excel中*Tensorboardtensorflow开发的一个可视化工具weightkbias允许在训练的时候用他们的API然后把实验记录下来后上传到他们的网页上就可以进行比较重复一个实验是非常难的开发的环境用的硬件是什么、新旧GPU可能会有点不一样用的库的版本Python本身也要去注意代码开发要做好版本控制可以将每个版本的代码放在同一个地方 需求的库也放在这里要注意随机性改变了随机种子模型抖动比较大的话说明代码的稳定性不是很好AutoML 让机器学习民主化不需要博士学位也能获得专业级的模型效果。但它不是万能的人类数据科学家的价值在于定义问题、理解业务、以及创造性地设计解决方案。9.2超参数的优化人工手动调学习率、骨干网络、检测器、batch size 等参数效率极低靠程序自动遍历、筛选最优模型配置。Search Space 搜索空间告诉程序要调哪些参数、取值范围是什么HPO 算法两种策略1. Black-box黑盒 HPO核心定义在超参优化中将完整训练流程视作黑盒每一组待测试超参配置trial都必须完整跑完全部训练周期得到最终验证指标后才会评判优劣2. Multi-fidelity多保真度 HPO核心定义通过修改训练任务、降低单次试验计算开销大幅加速超参搜索1采样缩小后的子集数据集进行训练2缩减模型规模例如减少网络层数、通道数3提前终止效果差的超参配置的训练过程Black-box 虽然会贵一点但是任务计算量比较小或优化算法不知道的话这个方法会比较好Multi-fidelity知道一些任务的细节可以将任务弄小一点这样每次试验的时候成本没有那么高。Grid search遍历规则预先给每个超参划定离散取值列表程序穷举所有参数笛卡尔积组合执行逻辑空间内每一组参数都完整训练评估不漏掉任何搭配优点全局全覆盖只要网格划分足够细一定能找到空间内最优参数逻辑简单、易实现 缺点组合数量随超参数量指数爆炸你之前那张多骨干、多检测器的大搜索空间完全无法使用算力消耗极高。Random search采样规则不遍历全部组合设置最大试验次数n每次从搜索空间随机抽取一组参数核心优势高维空间下随机采样更容易命中关键敏感超参的优质取值同等算力下效果普遍优于网格搜索优点不会产生指数级组合爆炸适合中等规模搜索空间代码实现简单缺点无法保证覆盖全部参数组合存在错过全局最优的风险纯随机无历史信息复用算力依然有浪费。Bayesian OptimizationBO贝叶斯优化迭代学习超参数 (HP) 到目标函数的映射关系基于过往所有调参实验结果依靠当前模型预测值挑选下一组最值得测试的超参。Surrogate模型就是拟合超参数与目标函数之间关系的模型可以采用概率的一些regression模型可以使用随机森林或者是高斯过程随着采样的越来越多对整个模型的进步会越来越准。获取函数Acquisition function是贝叶斯优化中另一个要建模的模型它会去评估下一个点应该去取谁对每一个超参数都会去预测一个值在一开始的时候其实跟random search差不多获取函数还不够好就只能随机挑值来做再后期的时候建模比较准会比较好一点随机搜索是并行的算法贝叶斯优化是顺序的算法采下一个点需要等上一个完成才行Successive Halving连续减半算法假设初始n16组参数基础轮次m5第 1 轮16 组全部训练 5epoch → 淘汰后 8 组最优保留第 2 轮8 组再训练 5epoch → 淘汰后 4 组最优保留第 3 轮4 组训练 10epoch → 淘汰后 2 组最优保留第 4 轮2 组训练 20epoch → 最终留下 1 组最优完整训练首先选取n个超参数然后每个超参数训练m个epoch把数据扫个m遍然后把好的超参数留下一半剩下的一半不要epoch还是m在下一次迭代超参数还是留下一半而epoch变成了原来的两倍这样的过程一直重复直至留下一个超参数为止。n与m的选取要基于预算而言的预算多n就取大一点但是n与m不好取Hyperband超带算法循环执行多组不同配比的 Successive Halving第一轮n极大m极小 → 海量低保真粗筛极致探索全局搜索空间后续每一轮逐步降低n、拉高m → 减少采样数量给剩余配置分配更长训练轮次深度挖掘优质区域多轮结果融合同时兼顾全局探索与局部精细调优。hyperband的好处是说对n与m的选取不会那么敏感会多跑几次多几个组合这样就不用怎么操心n还有算法在exploration与exploitation的权衡这个算法都算了一遍

相关新闻

Rock‘em Sock‘em V2 Z轴关节:whopping_Voron_mods beta版安装与测试

Rock‘em Sock‘em V2 Z轴关节:whopping_Voron_mods beta版安装与测试

Rockem Sockem V2 Z轴关节:whopping_Voron_mods beta版安装与测试 【免费下载链接】whopping_Voron_mods 项目地址: https://gitcode.com/gh_mirrors/wh/whopping_Voron_mods whopping_Voron_mods项目的Rockem Sockem V2 Z轴关节是一款为3D打印机设计的创新…

2026/7/22 18:59:23阅读更多 →
从Prompt工程师到课程架构师:AI时代教程内容创作者不可错过的5重能力跃迁

从Prompt工程师到课程架构师:AI时代教程内容创作者不可错过的5重能力跃迁

更多请点击: https://intelliparadigm.com 第一章:从Prompt工程师到课程架构师:AI时代教程内容创作者不可错过的5重能力跃迁 当提示词(Prompt)不再只是与大模型对话的“开关”,而成为教学逻辑的载体、知识…

2026/7/22 18:59:23阅读更多 →
低代码开发新工具:GitHub_Trending/cla/claude-skills可视化编程技能

低代码开发新工具:GitHub_Trending/cla/claude-skills可视化编程技能

低代码开发新工具:GitHub_Trending/cla/claude-skills可视化编程技能 【免费下载链接】claude-skills 345 Claude Code skills & agent skills & plugins (30 Agents, 70 custom commands, 330 skills, customizable references, scripts)for Claude Code, …

2026/7/22 18:59:23阅读更多 →
如何使用MathGenerator快速生成高质量数学题?新手入门完整指南

如何使用MathGenerator快速生成高质量数学题?新手入门完整指南

如何使用MathGenerator快速生成高质量数学题?新手入门完整指南 【免费下载链接】mathgenerator A math problem generator, created for the purpose of giving self-studying students and teaching organizations the means to easily get access to high-quality…

2026/7/22 19:51:33阅读更多 →
2026楼宇自控厂家/能耗监测系统厂家(优先推荐:裕乾 YUQIAN,国产一体化标杆优选选)

2026楼宇自控厂家/能耗监测系统厂家(优先推荐:裕乾 YUQIAN,国产一体化标杆优选选)

一、楼宇自控厂家(优先推荐:裕乾 YUQIAN,国产一体化标杆优选)1、裕乾(重点推荐,全栈自研楼宇自控源头厂商)企业资质背书裕乾(YUQIAN,北京裕乾信息技术有限公司/山东裕乾电子科技有限公司))为国家级高新技术企业、双软认证企业、AAA 级信用示范…

2026/7/22 19:51:33阅读更多 →
NPS Enhanced与Nginx配合使用:实现HTTPS加密与真实IP透传的最佳实践

NPS Enhanced与Nginx配合使用:实现HTTPS加密与真实IP透传的最佳实践

NPS Enhanced与Nginx配合使用:实现HTTPS加密与真实IP透传的最佳实践 【免费下载链接】nps NPS Enhanced — Lightweight intranet tunneling and reverse proxy with Web UI | NPS 内网穿透 反向代理 增强版 全修 新版 二开 项目地址: https://gitcode.com/gh_mir…

2026/7/22 19:51:33阅读更多 →
Niva vs Electron:为什么3MB的轻量级框架更适合现代桌面应用开发?

Niva vs Electron:为什么3MB的轻量级框架更适合现代桌面应用开发?

Niva vs Electron:为什么3MB的轻量级框架更适合现代桌面应用开发? 【免费下载链接】niva 一个基于 Tauri WRY 跨端 Webview 库的超轻量极易用的跨端应用开发框架。 项目地址: https://gitcode.com/gh_mirrors/ni/niva 在当今快速迭代的软件开发领…

2026/7/22 19:51:33阅读更多 →
如何快速上手Fireplace?5分钟搭建你的第一个炉石传说Python模拟器

如何快速上手Fireplace?5分钟搭建你的第一个炉石传说Python模拟器

如何快速上手Fireplace?5分钟搭建你的第一个炉石传说Python模拟器 【免费下载链接】fireplace A Hearthstone simulator in Python 项目地址: https://gitcode.com/gh_mirrors/fire/fireplace Fireplace是一款基于Python开发的炉石传说模拟器,能够…

2026/7/22 19:51:33阅读更多 →
Java中数组的介绍与实战

Java中数组的介绍与实战

目录 1.初识数组 2.数组的简单应用 1】求和 2】取最小值、最大值 3】求平均值 3.数组的进阶实战 注册登录1.0: 模拟计算器: 1.初识数组 数组是最基础、最底层的线性数据结构,其可以存储多个同类型的数据、变量。(数据结构是数…

2026/7/22 19:49:33阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 0:53:59阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 0:53:59阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 0:53:59阅读更多 →
中小企业小程序开发公司怎么选:预算、上手和售后避坑指南

中小企业小程序开发公司怎么选:预算、上手和售后避坑指南

中小企业做小程序,最常见的矛盾是预算有限,但又不希望功能太单薄;没有技术团队,但又希望后续能自己运营;想快速上线,又担心隐性收费和售后失联。选型时如果只看“低价套餐”或“案例数量”,很容…

2026/7/22 0:01:17阅读更多 →
GEO优化如何沉淀长期内容资产?广拓时代谈AI搜索时代的内容ROI

GEO优化如何沉淀长期内容资产?广拓时代谈AI搜索时代的内容ROI

企业做营销,最怕钱花完了,资产没有留下。 效果广告能带来一段时间的曝光,但预算停止后,流量往往也随之停止。短视频内容可能在几天内冲高,也可能很快沉下去。AI搜索时代,企业需要重新思考一个问题&#xff…

2026/7/22 0:01:17阅读更多 →
Agent 终态判定:何时该停止思考、给出最终回复

Agent 终态判定:何时该停止思考、给出最终回复

Agent 终态判定:何时该停止思考、给出最终回复 一、你的 Agent 在"再想想"的循环里绕了 12 轮,用户已经关窗口了 Agent 与人最大的区别是:人知道什么时候该停下来给答案,Agent 会一直"想"下去。你给 Agent 接…

2026/7/22 0:01:17阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/21 22:53:50阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/22 18:55:50阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/22 18:55:50阅读更多 →