【AI 】技术日报(2026-07-23)
本文由「AI 技术日报」自动整理聚焦技术方向重点关注国内大厂动态。内容基于公开报道翻译与整理日期2026-07-23。AI 技术日报2026-07-23Kimi K3 掀起 2.8 万亿参数开源风暴字节 Seedance 2.5 一镜到底 30 秒前言过去一周国产大模型再次成为全球 AI 圈的焦点。月之暗面Moonshot AI在 2026 世界人工智能大会WAIC前夕甩出「王炸」——全球首个 3 万亿参数级别的开源模型 Kimi K3一举登顶前端代码竞技场并直接引发海外资本市场对 OpenAI、Anthropic 估值的重新评估。与此同时字节跳动的视频生成模型 Seedance 2.5、谷歌的 Gemini 3.6 Flash 系列也相继落地。本期日报从技术视角带你快速读懂本周最值得关注的几条 AI 进展。一、月之暗面 Kimi K3全球最大开源模型2.8 万亿参数登顶代码竞技场1. 核心看点2026 年 7 月 16 日月之暗面正式发布新一代旗舰模型Kimi K3。这是目前全球参数规模最大的开源大模型也是全球首个开源的 3 万亿3T级别模型发布时间恰逢 2026 世界人工智能大会揭幕前夕。关键指标参数总参数量2.8 万亿2.8T架构稀疏 MoE混合专家专家数量896 个专家每次推理激活 16 个激活参数量约 50~60B 量级非官方估算上下文窗口100 万 Token1M原生能力原生视觉理解多模态开源计划2026 年 7 月 27 日前开放完整权重2. 技术架构拆解Kimi K3 之所以能在如此庞大的参数规模下保持可用的推理成本核心在于两项自研技术KDA 混合线性注意力Kimi Delta Attention这是月之暗面自研的注意力计算架构。它在部分层用线性缩放的注意力替换了传统的二次复杂度quadratic注意力同时在关键层保留完整注意力从而在处理长文本时平衡效率与精度。官方架构进一步描述为「KDA 主导的线性注意力 周期性的全注意力层」的混合设计。注意力残差Attention ResidualsAttnRes通过在网络深度方向上保留前序计算中的注意力权重提升模型对复杂任务中长距离依赖关系的捕捉能力。Stable LatentMoE 原生视觉配合稳定的隐空间 MoE 路由与原生视觉支持整体扩展效率相比上一代提升约2.5 倍。简单说K3 用「896 选 16」的稀疏激活把 2.8T 的庞大权重压到了约 50B 量级的实际激活开销这正是它能以开源姿态挑战顶级闭源模型的关键。3. 性能与定价性能综合能力逼近 Claude Fable 5、GPT-5.6 Sol 等顶级闭源模型。在前端代码竞技场中K3 以1679 分登顶超越 Claude Fable 5成为「排名第一的前端编码模型」。API 定价输入20 元 / 百万 Token缓存命中仅 2 元输出100 元 / 百万 Token。得益于 Mooncake 分离式推理架构编程场景缓存命中率超90%实际成本约为标准价格的1/4。生态进展7 月 21 日国家超算互联网上线 Kimi K3 模型 API 调用服务且兼容 OpenAI 与 Anthropic 接口规范开发者无需繁琐环境配置即可快速接入。推理框架侧vLLM 已放出对 Kimi K3 的生产级支持预览。开发者提示完整模型权重含技术报告预计 7 月 27 日前面向全球开源社区发布采用开放权重模式可下载部署、微调与二次开发。想私有化部署的团队可以提前准备算力与量化方案社区已在讨论 MXFP4 量化。二、字节跳动 Seedance 2.5单次推理直出 30 秒 4K 视频字节跳动在火山引擎 FORCE 大会上推出的视频生成模型Seedance 2.5本月初正式发布。它最大的突破是摆脱「拼接」的限制一镜到底在单次推理single inference pass中直接生成最长30 秒的连续片段无需分段拼接、无需扩展重绘也不会出现跨时长的一致性衰减。作为对比多数竞品模型上限约在 8~15 秒需要把短片拼接起来。原生 4K 同步音频仅凭一条文本提示即可生成原生 4K 分辨率、带同步音频的视频。多模态参考支持最多50 个全模态素材输入图 / 视频 / 音频R2V 参考控制更精细面向生产级影视内容创作。对于内容创作者和视频工作流而言「30 秒一镜直出」意味着分镜叙事的连贯性大幅提升后期拼接的工作量显著下降。三、谷歌 Gemini 3.6 Flash 系列更省 Token 的 Agent 专用档位7 月 21 日谷歌一次性发布三款新 Gemini 模型均属 Flash 系列主打速度、成本与高吞吐量的智能体Agentic工作负载而非最深层推理Gemini 3.6 Flash主力工作马定位编程、知识工作与多模态应用。在 Artificial Analysis Index 上比 3.5 Flash减少 17% 的输出 Token在 Datacurve 的 DeepSWE 基准上降幅高达65%。定价为输入$1.50 / 百万 Token、输出$7.50 / 百万 Token前代输出为 $9。Gemini 3.5 Flash-Lite最快最省面向对延迟和成本敏感的高吞吐场景约350 Token/s的输出速度定价输入$0.30、输出$2.50 / 百万 Token。开发者可调节「思考等级」在低成本与更强推理间权衡。Gemini 3.5 Flash Cyber网络安全专用为谷歌 CodeMender 安全智能体供能针对漏洞检测与修补微调因双重用途风险仅向政府和受信任伙伴限量开放。谷歌同时预告了 3.5 Pro 与 Gemini 4Flash 档位的「降本增效」竞赛还在继续。四、行业动态速览OpenAI 冲刺 IPOOpenAI 已向 SEC 秘密递交 S-1 注册文件由高盛、摩根士丹利护航最快可能在 2026 年 9 月上市。3 月融资后估值约8520 亿美元年化营收已突破 250 亿美元分析师认为公开市场估值有望冲击万亿美元。Kimi K3 冲击波受 K3 开源发布影响海外市场对 OpenAI 与 Anthropic 的预期估值一度合计蒸发约3920 亿美元凸显开源前沿模型对闭源商业模式的冲击。Karpathy 加盟 AnthropicOpenAI 联合创始人、前特斯拉 AI 负责人 Andrej Karpathy 已于 5 月加入 Anthropic 预训练团队牵头「用 Claude 加速预训练研究」的方向押注 AI 辅助研发而非纯算力的自我改进路线。五、小结本周的主线非常清晰国产开源正在改写全球大模型的成本与格局。Kimi K3 用 2.8 万亿参数 混合线性注意力 稀疏 MoE 的组合证明了「开源也能上前沿」并把顶级能力的价格打到了闭源模型的几分之一字节 Seedance 2.5 则在视频生成赛道用「一镜到底」拉开了工程化差距。海外方面谷歌在 Flash 档位持续降本增效OpenAI 则加速资本化。对开发者来说接下来值得重点跟进的是7 月 27 日 Kimi K3 完整权重与技术报告的开源——这可能是决定下半年私有化部署与 Agent 应用走向的关键节点。参考来源新华网《新突破 中国企业发布全球最大规模的开源模型 Kimi K3》 https://www.news.cn/tech/20260717/01c04372f89a46e480206e1da2fb8e8c/c.html新浪财经《2.8 万亿全球最大开源模型发布月之暗面发布 Kimi K3》 https://finance.sina.com.cn/jjxw/2026-07-17/doc-iniiccva1448043.shtml知乎《迈向 2.8 万亿参数开源时代月之暗面 Kimi K3 旗舰模型技术拆解》 https://zhuanlan.zhihu.com/p/2061367670323392623vLLM Blog《A Preview of Production-Scale Kimi K3 Support on vLLM》 https://vllm.ai/blog/2026-07-22-kimi-k3-previewHugging Face《Kimi K3 Model Overview — 2.8T Parameters, MXFP4 Quantization》 https://huggingface.co/blog/ResterChed/kimi-k3-model-overview-mxfp4-quantization-open-weiIT 之家 / linux.do《字节跳动 AI 视频生成大模型 Seedance 2.5 将于 7 月初发布》 https://linux.do/t/topic/2456094Imagine.art《Seedance 2.5 Guide To Next Level Video Generation》 https://www.imagine.art/blogs/seedance-2-5-guideGoogle Blog《Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber》 https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/MarkTechPost《Google Releases Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber》 https://www.marktechpost.com/2026/07/21/google-releases-gemini-3-6-flash-3-5-flash-lite-and-3-5-flash-cyber-a-cheaper-more-token-efficient-flash-tier-built-for-agentic-workloads/Yahoo Finance《OpenAI Files for IPO After Raising $122 Billion at $852 Billion Valuation》 https://finance.yahoo.com/markets/stocks/articles/openai-files-ipo-raising-122-200440504.htmlIG《Kimi K3 shock wipes $392 billion from OpenAI and Anthropic valuations》 https://www.ig.com/en-ch/news-and-trade-ideas/kimi-k3-shock—392-billion-now-wiped-from-expected-valuations-o-260721TechCrunch《OpenAI co-founder Andrej Karpathy joins Anthropic’s pre-training team》 https://techcrunch.com/2026/05/19/openai-co-founder-andrej-karpathy-joins-anthropics-pre-training-team/免责声明本文为技术资讯整理部分数据来自第三方公开报道可能存在偏差请以官方发布为准。

相关新闻

Qwen3.5小模型端侧部署与优化实战

Qwen3.5小模型端侧部署与优化实战

1. Qwen3.5小模型端侧部署概述Qwen3.5系列是阿里巴巴推出的新一代语言模型,其中0.8B/2B/4B小模型凭借其轻量级特性,成为端侧设备离线部署的理想选择。这些模型在保持较高性能的同时,大幅降低了硬件需求,使得在普通智能手机上运行成…

2026/7/23 16:56:40阅读更多 →
PPG对体温的量化准备工作

PPG对体温的量化准备工作

目前俩个理论比较肯定:一、单PPG下的PWTT替代定义(核心算法)放弃绝对传导时间,改用同一脉搏波周期内的相对时间特征,它们与体温-血管张力的映射关系与PWTT等价。推荐特征1:标准化收缩期上升时间&#xff08…

2026/7/23 16:56:40阅读更多 →
AI技术如何革新上位机开发:机器学习与工业自动化融合

AI技术如何革新上位机开发:机器学习与工业自动化融合

1. AI在上位机开发中的应用概述上位机作为工业自动化系统中的"大脑",长期以来承担着数据采集、设备监控、流程控制等核心职能。随着AI技术的快速发展,传统上位机开发模式正在经历革命性变革。在实际项目中,我们发现AI技术至少能在三…

2026/7/23 16:56:40阅读更多 →
【Python】 剪辑法欠采样 CNN压缩近邻法欠采样

【Python】 剪辑法欠采样 CNN压缩近邻法欠采样

借鉴:关于K近邻(KNN),看这一篇就够了!算法原理,kd树,球树,KNN解决样本不平衡,剪辑法,压缩近邻法 - 知乎 但是不要看他里面的代码,因为作者把代码…

2026/7/23 18:16:56阅读更多 →
Gitlab: 私有化部署

Gitlab: 私有化部署

目录 1. 说明 2. 服务器 3. 安装 4. 配置实践 4.1 人员与项目 4.2 部署准备 4.2.1 访问变量及用户账号设置 4.2.2 Gitlab Runner的设置 4.2.3 要点 5. 容器镜像(Container Registry) 5.1 准备 5.2 配置 5.3 测试 6. 应用项目 CI/CD 7. Version 17.6 安装 8. …

2026/7/23 18:16:56阅读更多 →
CentOS7 + 宝塔 Nginx + Java Jar:GitHub Actions 自动部署步骤

CentOS7 + 宝塔 Nginx + Java Jar:GitHub Actions 自动部署步骤

摘要:本文详细介绍了使用 GitHub Actions 实现前后端项目自动化部署的完整流程。从服务器环境准备、SSH 密钥生成、GitHub Secrets 配置,到部署文件编写、首次部署和日常发布,提供了全栈部署的一站式解决方案。文章包含具体的脚本示例、配置步…

2026/7/23 18:16:56阅读更多 →
esxi网卡直通

esxi网卡直通

ESXI设置网卡直通什么是直通?原理科普白话文解释:1.字面意思,很好理解,就是在虚拟机中,硬件不需要虚拟设备或者软件进行转换,虚拟机直接调用硬件,跟物理机一样。也就是某一个虚拟机,…

2026/7/23 18:16:56阅读更多 →
Tiva TM4C1292 EPI模块地址映射与非阻塞读FIFO机制详解

Tiva TM4C1292 EPI模块地址映射与非阻塞读FIFO机制详解

1. 项目概述与核心价值 在嵌入式系统开发,尤其是基于ARM Cortex-M内核的微控制器项目中,如何高效、可靠地扩展外部存储器和连接高速外设,是提升系统整体性能与功能复杂度的关键。Tiva™ C系列微控制器,特别是像TM4C1292NCZAD这类高…

2026/7/23 18:16:56阅读更多 →
打破文档孤岛:将知识库深度融入DevOps流水线

打破文档孤岛:将知识库深度融入DevOps流水线

在长期的研发效能优化实践中,我们经常会遇到一个极其割裂的场景:需求在Jira或禅道里流转,代码在GitLab里提交,流水线在Jenkins上跑着,而最核心的技术方案、接口文档和复盘报告,却孤零零地躺在Confluence或W…

2026/7/23 18:14:56阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/23 0:56:31阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/23 0:56:31阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 0:56:31阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:00:28阅读更多 →
从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:28阅读更多 →
油泥处理设备哪里能买到

油泥处理设备哪里能买到

油泥处理设备哪里有?这是许多从事油田、炼化、清罐业务的从业者最关心的问题。根据河南三丰环保设备有限公司的行业经验,选购油泥处理设备的核心在于设备能否适配当地环保法规与原料特性,而非单纯看价格。该公司总经理王钦田先生指出&#xf…

2026/7/23 0:00:28阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/22 22:56:18阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/22 18:55:50阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/22 18:55:50阅读更多 →