周晓农
码龄9年
求更新 关注
提问 私信
  • 博客:1,031,520
    动态:1,271
    视频:6
    1,032,797
    总访问量
  • 3,751
    原创
  • 1,465
    排名
  • 41
    粉丝
  • 2,000
    关注
IP属地以运营商信息为准,境内显示到省(区、市),境外显示到国家(地区)
IP 属地:河北省
加入CSDN时间: 2017-05-26

个人简介:致力于广告内容的千人千面。擅长程序化创意生成与点击率预估,致力于提升广告的美观度与用户体验。

博客简介:

weixin_29061821的博客

查看详细资料
个人成就
  • 获得12,284次点赞
  • 内容获得0次评论
  • 获得17,548次收藏
  • 代码片获得415次分享
创作历程
  • 3664篇
    2026年
  • 2篇
    2025年
  • 3篇
    2024年
  • 145篇
    2021年
  • 19篇
    2020年
成就勋章
创作活动更多

【多重好礼】鸿蒙心迹 · 开发录原创征稿活动

鸿蒙开发者的实战经验,值得被记录。从踩坑排查到项目复盘,从工具脚本到学习笔记,每一段真实的开发经历,都是社区最宝贵的技术资产。「鸿蒙心迹 · 开发录」正式启航,不限主题、随时可写,只要是鸿蒙开发相关的真实经验都欢迎投稿。 本活动为 [HarmonyOS 7.0 创新内容共创季](https://builderx.csdn.net/activity-site/harmonyos/activity2026)双轨征文之一,与[「共创季 · 稿事节」](https://harmonyosdev.csdn.net/6a97f0de2b83d06f0ecadec5.html)深度征文互补——「稿事节」写深度技术长文,「开发录」写日常开发实战笔记。 「开发录」每月一期,12月截止,本季共三期,投稿即有机会获得京东卡、CSDN博客流量券、亿万Token、社区定制周边好礼!

126人参与 去参加
  • 最近
  • 文章
  • 专栏
  • 代码仓
  • 资源
  • 收藏
  • 关注/订阅/互动
更多
  • 最近

  • 文章

  • 专栏

  • 代码仓

  • 资源

  • 收藏

  • 关注/订阅/互动

  • 社区

  • 帖子

  • 问答

  • 课程

  • 视频

搜索 取消

强化学习奖励工程实战:PyBullet清扫机器人十项复合奖励设计

强化学习训练中,奖励函数直接影响智能体最终的策略形态,是机器人控制任务落地的关键环节。从稀疏奖励到密集化复合奖励,奖励工程通过将单一目标拆解为引导、进度与约束等多维度信号,为策略提供连续、可学习的反馈。合理的奖励设计能提升训练稳定性与任务完成率,在强化学习项目中的价值等同算法与基础设施。在PyBullet仿真清扫机器人等典型场景中,通过垃圾检测、覆盖栅格、碰撞惩罚等10项复合奖励的配合与权重调优,可有效解决连续动作空间下探索困难、原地打转等常见问题,将清扫完成率与综合评分大幅提升。理解奖励工程的内在逻辑,对
原创
博文更新于 9 小时前 ·
54 阅读 ·
0 点赞 ·
0 评论 ·
2 收藏

Model-Optimizer 模型优化器实战:从计算图解析到量化压缩的推理加速指南

在深度学习模型部署中,推理延迟、显存占用和吞吐量是核心性能指标。模型优化器通过计算图解析、算子融合、量化压缩和并行策略选择,从系统层面自动优化模型执行效率。其技术价值在于降低推理成本、提升硬件利用率,广泛应用于云端推理、边缘设备部署和训练加速等场景。本文深入解析 Model-Optimizer 的设计思路与实操要点,涵盖性能分析、算子融合边界、量化校准方法及多卡优化策略,帮助算法与系统工程师快速实现模型推理加速与资源节省。
原创
博文更新于 9 小时前 ·
44 阅读 ·
0 点赞 ·
0 评论 ·
3 收藏

深度学习优化器实战指南:从原理到调参的完整拆解

在深度学习训练中,模型的最终性能不仅取决于网络架构,更与优化器的选择及配置密切相关。梯度下降作为最基础的优化思想,衍生出SGD、Adam、AdamW等算法,它们通过动量、自适应学习率等机制影响模型的收敛速度与泛化能力。学习率作为关键超参数,其调度策略与权重衰减、梯度裁剪等技巧协同作用,共同决定训练成败。本文从工程实践角度出发,系统梳理了主流优化器的工作原理、适用场景和超参数调优方法,并结合大batch、分布式训练和混合精度等真实场景,提供了loss异常、模型不收敛等问题的排查思路与解决路径,帮助开发者快速定
原创
博文更新于 9 小时前 ·
35 阅读 ·
0 点赞 ·
0 评论 ·
2 收藏

模型优化全流程:量化、剪枝与推理加速实战

在深度学习模型从训练环境迁移到CPU、NPU或边缘设备时,模型推理性能往往急剧下降,核心瓶颈在于计算图冗余、精度冗余与硬件适配性。模型量化、知识蒸馏与结构化剪枝作为三大主流压缩技术,分别从数值精度、知识迁移和结构精简三个维度降低模型复杂度。配合计算图优化,如算子融合与常量折叠,可以进一步去除冗余计算。通过校准数据集与精度验证,这些技术能够平衡推理时延与精度损失,在实际项目中实现数倍加速。以一台嵌入式设备上的视觉检测任务为例,通过模型优化工具的组合策略,成功将单帧推理时延从35ms降至21ms,模型体积缩减约
原创
博文更新于 9 小时前 ·
61 阅读 ·
0 点赞 ·
0 评论 ·
0 收藏

Model-Optimizer 实战:模型量化、剪枝与推理加速的工程化落地

模型量化、剪枝与算子融合是深度学习推理加速的核心技术,通过降低数值精度、去除冗余权重和合并计算图,显著减少模型体积与推理延迟。这些技术广泛应用于云端部署、边缘计算和端侧推理等场景,帮助开发者在有限硬件资源下实现高效推理。Model-Optimizer 将量化、剪枝、图优化与硬件后端适配统一为可配置的优化配方,支持 PTQ、QAT、结构化剪枝等策略,并强调校准集质量、敏感层跳过与增量式调优。本文结合工程实践,系统梳理从原始模型到部署包的完整优化流程与踩坑经验。
原创
博文更新于 9 小时前 ·
41 阅读 ·
1 点赞 ·
0 评论 ·
3 收藏

从零搭建AI工程能力:避开Demo到生产的那些坑

AI工程的核心不是模型调参,而是系统化的工程实践。一个完整的AI系统通常包含输入处理、知识检索、推理生成和输出后处理等模块,其中模型推理往往只占端到端延迟的60%,其余环节同样关键。理解这些模块的协作原理,能帮助开发者构建稳定、可扩展的AI应用。在实际场景中,从智能客服到内容审核,工程化能力决定了项目能否从Demo走向生产。本文围绕AI工程从零搭建的完整路径,拆解核心模块与常见陷阱,分享可落地的实践习惯。
原创
博文更新于 9 小时前 ·
107 阅读 ·
2 点赞 ·
0 评论 ·
1 收藏

hindsight:基于MCP与Docker的LLM Agent长期记忆系统落地实践

LLM Agent的记忆机制是当前AI工程化的关键瓶颈,其核心在于实现跨会话的持久化存储与选择性召回。通过MCP协议标准化记忆读写接口,结合Docker容器化部署,可构建独立于Agent框架的长期记忆服务。该方案解决了上下文窗口易失性、记忆冲突合并与时间衰减等结构性问题,适用于需要个性化上下文保持的客服、编程助手等场景。hindsight项目正是这一思路的工程化实践,为Agent记忆层提供了可部署、可扩展的基础设施。
原创
博文更新于 9 小时前 ·
58 阅读 ·
0 点赞 ·
0 评论 ·
1 收藏

中药识别系统落地实战:从数据准备到APP拍照识别的CNN全流程

卷积神经网络(CNN)是图像分类任务的核心技术,通过卷积核自动提取纹理、颜色和局部形状特征,在物体识别领域展现出稳定可靠的能力。合理的训练数据组织、有效的迁移学习策略以及前后端工程协作,是模型从实验室走向真实场景的关键。在实际应用中,基于PyTorch构建CNN模型,结合迁移学习可显著提升准确率;FastAPI提供高效推理接口,配合uni-app拍照上传,即可组成完整的识别闭环。以中药识别系统为例,这一套技术方案能直接落地于智慧药房、药材溯源和用药辅导等场景。文章围绕数据集的批次划分、训练参数调整、模型部署
原创
博文更新于 9 小时前 ·
18 阅读 ·
0 点赞 ·
0 评论 ·
3 收藏

中药识别系统全流程:从CNN训练到移动端部署

图像识别是计算机视觉中最基础也最实用的方向之一,其核心原理在于利用卷积神经网络自动提取图像特征并完成分类。深入理解图像分类的技术链路后会发现,数据集质量、预处理策略、模型选型与端侧部署共同决定了最终识别效果。本文以中药识别为例,介绍了从采集规范、VOC转COCO标注转换、数据增强,到ResNet与MobileNet选型对比、迁移学习调参,再到ONNX转NCNN的APP端集成优化,完整覆盖了一个细粒度图像识别项目的落地路径。该方案兼顾准确率与移动端推理速度,可推广到植物、食材、商品等识别场景,适合希望将深度学
原创
博文更新于 9 小时前 ·
63 阅读 ·
1 点赞 ·
0 评论 ·
3 收藏

从零搭建AI工程:模型到稳定服务的完整实践路径

大模型应用落地,难点往往不在模型本身,而在于如何构建稳定、可控、可维护的AI工程链路。从数据清洗、切分向量化,到模型选型与推理优化,再到API服务化与评测监控,每一个环节都决定系统能否真正承载业务流量。本文以RAG问答系统的搭建为例,梳理了AI工程的四层能力地图,包括数据工程层、模型工程层、应用编排层和部署可观测层,并分享了工具链选型、并发控制、成本优化等实战经验。只有走通从“能跑脚本”到“能交付系统”的全流程,才能让模型在真实场景中可靠工作。
原创
博文更新于 9 小时前 ·
50 阅读 ·
3 点赞 ·
0 评论 ·
3 收藏

superpowers技能包详解:为Claude Code与Codex CLI打造稳定AI编程工作流

AI编程助手在复杂工程任务中常表现不稳定,缺乏方法论约束,导致输出质量起伏不定。superpowers作为一套开源技能包,将资深工程师的隐式工作流固化为规范化skill文件,为Claude Code、Codex CLI等编程助手构建了从头脑风暴、方案设计、编码到测试的完整执行框架。其核心价值在于通过渐进式披露机制控制上下文窗口,让模型遵循成熟路径处理任务,显著提升多文件项目的开发效率与稳定性。本文从安装部署、核心skill拆解到Spring Boot等Java工程实战,系统性梳理了技能包的落地方法与调优经验
原创
博文更新于 9 小时前 ·
141 阅读 ·
1 点赞 ·
0 评论 ·
4 收藏

Model-Optimizer:面向NVIDIA GPU的量化、剪枝与蒸馏协同优化方法论

模型压缩是AI工程落地的核心环节,涉及量化(quantization)、剪枝(pruning)和知识蒸馏(distillation)三大基础技术。其本质是通过降低计算精度、削减冗余结构、迁移大模型知识,在保障精度前提下提升推理速度与内存效率。技术价值不仅体现在模型体积缩小与FPS提升,更在于适配GPU硬件特性(如Tensor Core、warp size、INT8 GEMM)以释放真实性能。典型应用场景包括边缘端实时检测(YOLO、ViT)、车载ADAS及医疗影像推理等对延迟、功耗与精度均有严苛要求的领域。
原创
博文更新于 9 小时前 ·
71 阅读 ·
3 点赞 ·
0 评论 ·
1 收藏

ExaServe超算级LLM部署:256节点3072副本架构与实操解析

大语言模型推理部署正从单机Demo走向大规模生产集群,其核心挑战在于分布式并行策略、KV Cache内存管理和拓扑感知调度。通过张量并行与流水线并行混合切分模型,结合PagedAttention与KV Cache量化技术,可显著提升单节点副本密度与显存效率。拓扑感知负载均衡与分层副本策略则进一步保障高并发下的低延迟与高可用。这些工程方法在AI中台、模型API服务等高吞吐场景中价值突出。ExaServe方案以256节点3072副本的规模,展示了超算级LLM推理服务在架构设计与实操落地上的完整思路。
原创
博文更新于 9 小时前 ·
68 阅读 ·
0 点赞 ·
0 评论 ·
1 收藏

CIFAR-100细粒度识别中Top1与Top5错误率的深层解析

在图像分类任务中,Top-k错误率是衡量模型判别能力的基础指标,其本质反映模型对类别语义空间的建模质量。Top1错误率聚焦于精确标签匹配,适用于粗粒度分类;而Top5错误率则体现模型的语义泛化能力,尤其在细粒度识别场景下更具鲁棒性。CIFAR-100作为典型的细粒度基准数据集,其100类被划分为20个语义重叠的超类,导致类别间特征距离极小——这使得Top1易受微小决策偏差影响,而Top5更能揭示模型是否锁定合理语义范畴。结合Softmax归一化、标签索引对齐与梯度可视化等工程实践,可显著提升评估可信度。本文
原创
博文更新于 9 小时前 ·
94 阅读 ·
1 点赞 ·
0 评论 ·
2 收藏

Model-Optimizer:模型优化与部署加速的完整实践指南

在人工智能工程化落地中,模型训练完成后往往面临部署阶段的性能断层:推理延迟高、内存占用大、精度波动,甚至算子不支持。模型优化作为连接训练框架与推理引擎的关键环节,通过计算图变换、算子融合、低精度量化等手段,在保持模型精度的前提下显著提升推理效率。ONNX作为通用中间表示,为跨框架、跨硬件的优化提供了统一基础。量化技术特别是训练后量化PTQ,可将模型体积压缩至四分之一并加速计算,而算子融合则通过合并Conv+BatchNorm+ReLU等典型结构降低访存开销。这些技术广泛应用于边缘设备、云端推理和实时检测等场
原创
博文更新于 9 小时前 ·
200 阅读 ·
2 点赞 ·
0 评论 ·
2 收藏

从零开始学AI工程:从模型训练到生产部署完整指南

AI工程并非单纯的算法调参,而是一条从问题定义、数据治理到模型部署、监控迭代的完整链路。在真实生产环境中,模型需要应对流量波动、数据漂移和推理延迟等挑战。掌握从零开始构建AI系统的能力,意味着理解数据版本管理、容器化服务化、监控运维等工程实践。本文基于个人实战经验,拆解一个客服工单自动分类的端到端案例,涵盖数据处理、预训练模型微调、FastAPI服务部署与Docker容器化,并讨论数据漂移检测与成本治理策略。无论你是转行开发者还是应届生,都能从中找到一条由浅入深、项目驱动的务实入门路径,真正让模型在真实世界
原创
博文更新于 9 小时前 ·
82 阅读 ·
3 点赞 ·
0 评论 ·
2 收藏

Superpowers实战:把AI编程代理调教成靠谱工程师

随着AI编程代理逐渐进入实际工程场景,如何保证代码生成质量已成为开发者关注的核心问题。大型语言模型本身具备基础编码能力,但缺乏对团队规范、项目结构以及“完成标准”的隐性认知,导致生成结果常常偏离预期。Superpowers通过将资深工程师的经验固化为结构化技能规则,在任务分解、上下文预处理、代码生成约束和自动检查等环节为代理提供明确指引,从而抬高AI输出的质量下限。这一思路适用于Codex等Agent式编程工具,尤其在Java、Spring Boot等企业级项目中,能有效减少手工修正成本。本文从安装配置到实
原创
博文更新于 9 小时前 ·
55 阅读 ·
0 点赞 ·
0 评论 ·
1 收藏

DeepSpeed Zero3 Offload失败?GCC版本与ABI兼容性排查指南

DeepSpeed Zero3 Offload是一种大模型显存优化技术,其核心依赖C++/CUDA算子编译与Python扩展加载。实现该能力的关键在于编译器ABI一致性、libstdc++符号兼容性及链接器行为控制——这直接关联GCC版本选择。当出现CUDA out of memory、undefined symbol或segmentation fault等典型错误时,问题往往不在PyTorch配置或模型代码,而源于GCC与PyTorch/CUDA驱动间的底层工具链断裂。尤其在Ubuntu 22.04、A1
原创
博文更新于 9 小时前 ·
143 阅读 ·
1 点赞 ·
0 评论 ·
2 收藏

企业级AI编程实战:从工具选型到工程化落地的完整指南

AI编程助手正从个人提效工具演进为企业研发基础设施,其核心在于将代码生成能力与现有工程体系深度融合。通过统一工具链、分层提示词工程、质量门禁与安全边界控制,企业可在保障代码合规与数据安全的前提下,将AI编程从个人技巧升级为组织能力。在单元测试生成、CRUD接口开发等高频标准化场景中,AI编程助手能显著提升交付效率,而混合工具策略与持续度量优化则确保成本可控与风格一致。企业级AI编程实战营正是围绕工具选型、提示词资产化、质量保障与工程融合四大命题,提供从试点到推广的系统化落地路径。
原创
博文更新于 9 小时前 ·
157 阅读 ·
2 点赞 ·
0 评论 ·
2 收藏

Superpowers加持Codex:从对话助手到自治编码代理

在AI辅助编程实践中,开发者常面临对话式工具只改单文件、不主动验证的局限,导致跨文件任务反复返工。通过引入技能包与工作流增强方案,可将编码代理从“你问我答”的助手升级为“任务自治”的智能体:先规划、再执行、后验证,形成完整闭环。Superpowers作为Codex CLI的增强层,利用可插拔技能包、状态持久化与强制测试机制,显著提升跨文件重构、遗留bug修复等复杂任务的完成度。本文从安装配置、真实项目实操到Java生态避坑,为工程团队提供可复用的AI编程自动化经验,帮助开发者从重复性上下文维护中解放出来,聚
原创
博文更新于 9 小时前 ·
69 阅读 ·
1 点赞 ·
0 评论 ·
2 收藏
加载更多