跳到正文
ZHX NEXUS Studio
返回

AI 考试笔记 · 知识图谱

编辑页面
理论题

第一部分 · 理论题(概念辨析与选择)

知识地图、四大分布、技术/概念分库、设计原则、数据流程、训练评估、易错否定汇总、拓展知识库。

0 · 知识地图总览

先建立"体系骨架",再填细节。下面三张图把零散考点连成网络:AI 能力层级、模型生产链路、评估与训练回路。
人工智能 AI机器学习 ML深度学习 DL包含关系:AI ⊃ ML ⊃ DL(逐级缩小的能力范围)
损失函数计算误差反向传播更新模型参数准确率(仅评估)训练回路:前四项"更新权重",准确率不参与更新,只评估好坏

提示:下文每个模块都带有"关联"说明,点击可跳到对应库。技术名(如 CTPN、CRNN)统一收在 第 2 节工具解耦库,概念辨析收在 第 3 节

1 · 概率论四大分布(核心工具)

这四种分布是概率论与数理统计的核心工具。概念看着分散,其实按"数据类型 → 解决问题"一一对应:独立随机事件的计数、有限重复试验的成功计数、连续数据的自然分布、实际观察与理论预期差异的假设检验。
  • 泊松分布(Poisson):单位时间随机事件发生次数。适用:独立随机事件计数
  • 二项分布:n 次试验中的成功次数。适用:有限重复试验的成功计数
  • 正态分布(高斯分布):连续测量值。适用:连续数据的自然分布
  • 卡方分布:统计检验。适用:评估实际观察与理论预期差异的假设检验
独立随机事件有限重复试验连续测量数据观测vs预期四类问题 → 四种分布,按"数据类型→用途"连线记忆
📌 泊松:事件计数📌 二项:成功次数📌 正态:连续值📌 卡方:检验差异
拓展(来自整理论证):
记忆口诀——"稀发事件用泊松, fixed 次数用二项,测出来是连续用正态,要验真假用卡方"。考试若问"以下哪个分布用于假设检验",选卡方;问"单位时间来电数"选泊松。四者难度:本组属 直选型,但常与"属于/不属于某分布场景"组合成中难度题。↩ 返回原文

2 · 专有技术 / 工具解耦库

把"会考的技术名/工具名"从概念里抽出来,按"是什么 + 用在哪 + 与谁关联"排列(不用卡片占位,便于日后追加新行)。带 ⛓ 的是关联线索。

神经网络 / 模型架构

CNN卷积神经网络
与图像相关。⛓ OCR 中负责"检测/找出位置";常与 RNN 配对做 OCR。华为题常考"不属于图像相关的"选 CNN 无关项。
RNN循环神经网络
处理时序 / 语音文本;LSTM 属于 RNN 变体⛓ OCR 中负责"识别/提取";语音识别模块常规组件。
CRNN卷积循环神经网络
OCR 文本识别经典模型,识别图片里单行不定长文本,三段式结构(考试高频):①卷积层 CNN(图像)→ ②循环层 RNN / 双向 LSTM(标签分布)→ ③转录层(CTC 损失函数 把标签分布翻译成最终文本)。⛓ 见下方关联图。
CTPNOCR 文本检测经典模型
是一个深度神经网络,使用多个卷积层。作用于文本检测 / 定位阶段。⛓ 与 CRNN 分工:CTPN 检测定位,CRNN 识别。
GAN生成对抗网络
组件包含判别器
TransformerNLP 主流架构
NLP 主流架构,是 BERT / GPT 等的底层网络。⛓ 见第 3 节"深度学习技术"。

框架 / 工具库

TensorFlow训练框架
支持分布式、TensorBoard 可视化、接口灵活;支持 GPU,不局限机器学习。加载已训练模型用 tf.keras.models.load_model()⛓ "如何加载模型"属高难度操作题,见第 8 节拓展。
PyTorch训练框架
负责自动微分的模块是 autograd
Scikit-learn (sklearn)传统机器学习库
非常适合表格结构化数据。与 TensorFlow/PyTorch(深度学习框架)区分。
Pandas数据分析
表格数据分析。python 数组作为模型输入。
ART对抗鲁棒性工具箱
Adversarial Robustness Toolbox。
AutoML自动机器学习
可自动完成特征工程、模型选择、超参调优;并非完全不需要人工干预

视觉 / 检测 / 标注工具

OCR光学字符识别
CNN 找位置/检测,RNN 识别/提取。⛓ 见神经网络节。
YOLO目标检测
目标检测(物体识别)经典算法
Attention-OCROCR 变体
优点不包括增强记忆功能
ModelArts华为云一站式 AI 开发平台
图片目标标注默认矩形框(长方形);AI 链路见下;数据管理模块含数据集管理/标注/处理(清洗、增强、校验),没有采集功能;AI Gallery 是资产集市(模型/数据集/算子);支持 PyTorch/TensorFlow/MindSpore、AutoML、端边云一键部署。

原型 / 设计工具

InVision原型工具
可交互原型、模拟产品体验
Adobe XD原型工具
原型设计。
CRNN 三段式(OCR 文本识别)① 卷积层 CNN提取图像特征② 循环层 RNN双向LSTM 标签分布③ 转录层 CTC翻译为最终文本分工对照:CTPN(检测定位)+ CRNN(识别)= 完整 OCR 流水线CTPN 检测 → CRNN 识别

3 · 核心概念区分(概念理解)

把"长得像、容易混"的概念成对/成组辨析。否定表述已用红字标出。

分类 vs 回归

  • 分类:预测类别(离散值)。代表:决策树、随机森林、SVM、逻辑回归。
  • 回归:预测数值(连续值)。代表:线性回归。

精确 / 召回 / 准确率 / F1

  • 召回:真的里面抓多少(查全率,防漏)。
  • 精确:猜正的里面对多少(查准率,防误报)。
  • 准确率:全部样本猜对比例。
  • F1:精确召回综合得分。
  • 混淆矩阵维度:真实标签、预测标签(TP,以 T 为主)。
拓展(来自对话整理):
F1 是精确率 P 与召回率 R 的调和平均:F1 = 2PR/(P+R)。当考题问"综合得分"或"平衡精确与召回"即指 F1。该组是高频长题,建议配混淆矩阵手抄一遍。↩ 返回原文

监督 / 无监督 / 强化学习

  • 监督学习:已有标注数据集,学习输入→标签映射。如逻辑回归(分类)、KNN 近邻、神经网络。分类(离散标签)/ 回归(连续数值)均属监督。
  • 无监督学习:无标签。聚类(把对象集合分组)、降维。K-means、谱聚类。
  • 强化学习:智能体交互环境,靠奖励信号学习策略。

聚类算法归类(易出"属于/不属于"长题)

无监督学习
聚类算法(属于):K-means、谱聚类、DBSCAN 等
降维(属于无监督)
不属于聚类 / 不属于无监督
K-means 不是调参方法(它是模型算法)
决策树不是深度学习,是传统机器学习
CNN 不属于邀约机器人语音识别模块常规组成(见第 7 节)
拓展(来自整理论证):
判定套路:看到"属于聚类算法"→ 找无监督分组类(K-means/谱聚类);看到"不属于"→ 优先排除"调参方法""监督分类器""深度学习专属"。聚类常与降维并列考,记住两者都属无监督。↩ 返回原文

特征选择三类

特征选择
过滤式 Filter
包裹式 Wrapper
嵌入式 Embedded
决策树(例)
随机森林(例)

降维算法辨析(LDA / PCA / ICA / 特征识别)

LDA(线性判别分析)不属于"单纯寻找数据分布最优子空间、去除相关性"的无监督降维——它是有监督,目标是让不同类别尽可能分开。
  • PCA 主成分分析(正确降维):对原始坐标轴旋转变换,找方差最大的新坐标轴(主成分),降维并消除特征间相关性,无监督;底层基于 SVD,随机 SVD 是其优化变种。
  • ICA 独立成分分析:把混合信号拆成互相独立的源信号(独立比不相关条件更强)。
  • 特征识别不是降维算法,只是识别特征的过程。

预剪枝 vs 后剪枝

  • 预剪枝:树长到一半提前停止生长(边建边剪)。
  • 后剪枝:先生成完整大树,再从底部往上剪(建好再剪)。
  • 剪枝作用:降低过拟合,提升泛化能力

关键词提取算法

重点:SSA 不是关键词提取算法
  • 常用:TF-IDF、TextRank、LDA(次要)。

损失函数(分类 / 回归)

这块比较难理解,按"任务类型 → 损失"记:
  • 回归(预测连续数字):MSE(L2 均方损失)、MAE(L1 平均绝对损失)。
  • 分类(预测类别):交叉熵(深度学习分类最常用)、Hinge(SVM)、0-1 损失(理想分类损失,无法直接优化)。

池化层 & 梯度消失

  • 池化层作用:缩小特征图(减少参数)、降低计算量、一定程度防止过拟合。
  • 梯度消失 → 靠 ReLU、残差网络、批量归一化 BN 解决。
  • Sigmoid 极易梯度消失

语音识别模块组件(N-gram/RNN/ASRT/LSTM/CNN)

  • 属于:N-gram(语言模型,判断语句通顺)、RNN(序列建模)、ASRT(开源语音识别库)、LSTM(RNN 改进,时序建模)。
  • CNN 不属于邀约机器人语音识别模块常规组成(多用于图像,少量语音应用但不常规)。

深度学习技术(Word2Vec/Transformer/BERT/K-means/决策树)

  • 属于深度学习:Word2Vec(词向量)、Transformer(基础架构)、BERT(基于 Transformer 的预训练语言模型)。
  • K-means 不属于深度学习(它是无监督聚类)决策树不属于深度学习(传统机器学习)

4 · 设计原则与人因

偏产品 / 交互 / 职业道德考点,多为直选。

高效性原则

目标:减少操作步骤,提升操作效率
  • 简洁:界面干净。
  • 一致:逻辑统一。
  • 容错:允许失误。

人因 / 评估 / 其他

  • Fitts 定律(菲茨定律):用于预测用户的点击速度
  • 启发式评估:由专家根据预设可用性原则对界面快速评估,不需要用户参与
  • 主观审核 = 用户主观感受
  • 智能客服系统中 NLP 主要作用提供多语言支持
  • 新职业道德核心理念:服务意识;增强职业道德可协调员工关系、增强企业内部凝聚力
  • 加班费:150%
  • 接入网络可多级联接。
  • 通配符 * = 任意多个字符
  • 数字、数据属于数学语言
  • 文本情感分析在自然语言处理领域是一个研究分支
  • 华为相关题目:都是芯片;选择"无关的"一般选界面友好度 / 精美度(有关的选这个)。

5 · 数据全流程(预处理 → 标注 → 特征)

数据生命周期相关考点,按"清洗→变换→标注→特征"串起来。

数据预处理与建模任务

数据建模任务不包括"数据预处理"本身——建模任务是分类 / 回归 / 聚类。
  • 数据预处理:清洗、集成、变换、规约。
  • 数据清洗提升数据质量
  • 数据变换将数据转变为符合要求的形式
  • 数据拆解发现数据中的隐藏模式和趋势

缺失值处理

  • 删除、插补、变换 / 新增缺失标记。
  • 聚类场景的同类均值插补(无监督填补)。

数据标注

  • 按标注对象划分:图像、文本、语音三类。
  • 半结构化标注 = 标签值(结构化)+ 标签域(非结构化)
  • 机器标注算法对高层语义对象识别和提取效果不好。
  • 文本数据标注需要遵循一定质量标准 → 错误(应为"需要遵循")

结构化 vs 非结构化

  • 非结构化数据:图片、文本、音视频。适用手段:NLP、CV、神经网络、聚类(向量化后)、计算机视觉。
  • 决策树:擅长结构化表格数据。

易混辨析

  • 数据平滑 ≠ 去除噪声(平滑是降噪的一种手段,但不等同"去除噪声"这一表述在题中作否定考)。
  • 处理分类数据类别不平衡:使用 SMOTE(合成少数类过采样技术)
  • 管理者识别需求要利用信息支持评审过程输入输出 → 错误(识别需求是挖掘业务目标)。

6 · 模型训练与评估

训练回路、调参、过拟合、交叉验证等。

训练回路

损失函数 → 计算误差 → 反向传播 → 更新模型参数
准确率只用来评估模型好坏,不更新权重

超参数寻优(调参)

  • 方法:网格搜索、随机搜索、贝叶斯优化。
  • K-means、KNN 是模型算法,不是调参方法

缓解过拟合(按时间线)

训练之前:扩充数据集数据增强 / 早停 / 降复杂度训练中:Dropout / BN / L1L2学习率:主要加快模型训练速度(非直接防过拟合)

K 折交叉验证 & 点云 & 模型评价

  • K 折交叉验证两大作用:评估模型性能、选择最优模型。
  • 点云基础信息三维坐标、颜色、反射强度纹理 / 距离 不是点云基础信息
  • 模型评价流程:产出评价结果 → 复核重审 → 确定后续方案。

优化器 / 系统设计 / 评估指标

  • AdaGrad:累积梯度 → 分母变大 → 学习率持续减小
  • AI 智能系统设计顺序:首先确认数据 → 业务需求 → 系统架构 → 算法开发 → UI 交互。
  • mAP:平均精度均值(mean Average Precision)。
  • 决策树叶节点决策的结果
  • 全连接神经网络:是神经网络模型中的一种。

流程优化 / 业务分析风险(低难度直选题)

  • 流程优化方式不包括配套方案设计
  • 以下哪项不是业务分析阶段需要识别的风险:模型过拟合风险(属于模型训练阶段才出现的算法风险)
拓展(来自整理论证):
业务分析阶段识别的是"业务侧风险"(需求偏差、数据可得性、合规等);模型过拟合是"训练/算法阶段"才暴露的风险,故不在业务分析清单内。此题为典型直选低难度。↩ 返回原文

华为 ModelArts 完整 AI 链路

数据管理算法开发模型训练模型管理部署上线

7 · 易错否定考点汇总(红字重点背)

把所有"不是 / 不属于 / 不包括 / 不等于 / 不更新"集中,考前一眼扫。
  • SSA 不是关键词提取算法(TF-IDF / TextRank / LDA 才是)。
  • K-means、KNN 不是调参方法(是模型算法)。
  • 准确率不更新权重,只评估模型好坏。
  • CNN 不属于语音识别模块常规组成。
  • K-means 不属于深度学习决策树不属于深度学习
  • LDA(线性判别分析)不是无监督去相关降维(是有监督分类降维)。
  • 特征识别不是降维算法
  • AutoML 并非完全不需要人工干预
  • 数据平滑 ≠ 去除噪声
  • 模型过拟合风险不属于业务分析阶段(属模型训练阶段)。
  • 流程优化不包括配套方案设计
  • Attention-OCR 优点不包括增强记忆功能
  • ModelArts 数据管理模块没有采集功能
  • 文本数据标注需要遵循质量标准(原题说"不需要"是错误的)
  • 管理者识别需求不是"利用信息支持评审输入输出"(应为挖掘业务目标)
  • 纹理 / 距离不是点云基础信息(基础是三维坐标/颜色/反射强度)。

8 · 拓展知识库(可继续追加)

以下为整理时生成的说明,对应前文的"拓展"块。后续对话中新增的内容可继续往这里加,并保留"↩ 返回原文"链接。

① 概率分布如何串联记忆

四类分布覆盖"计数→试验→连续→检验"全谱。记忆锚点:泊松(事件数)、二项(成功数)、正态(测量值)、卡方(验差异)。考试若以"属于/不属于某场景"出题,先判数据类型再选分布。

② 加载 TensorFlow 模型(操作题)

使用 tf.keras.models.load_model() 加载已训练模型——这是"方法类"高难度操作考点,区别于"模型算法"类考点。注意 load 是"加载"动作,不与 K-means / 调参方法混淆。

③ PCA 与 SVD 关系

PCA 核心是对协方差矩阵做特征值分解,等价于对数据中心化后的矩阵做奇异值分解(SVD);随机 SVD 是大矩阵的优化变种,用于加速。记住:PCA 既降维又去相关,且是无监督。

④ CRNN 与 CTPN 的 OCR 分工

CTPN 负责"在哪里"(文本检测/定位,多卷积层);CRNN 负责"是什么"(文本识别,三段式 CNN→RNN→CTC)。二者拼成工业级 OCR 流水线。CSDN 等资料常以此作高频例题。

⑤ 监督/无监督/强化 速判

有标注→监督(分类/回归);无标注找结构→无监督(聚类/降维);与环境交互拿奖励→强化。K-means、谱聚类、PCA 均属无监督。

(本库将随后续对话持续追加,每条对应正文拓展块可点击返回。)

实操题

实操题1(业务流程 / 代码 / 系统设计)

以下整理自 Word 试卷《实操题答案汇总》:流程设计、流程优化、模型导入与评估代码、训练集不一致排查、培训与指导。

9 · 实操题详解

实操侧重"动手 + 设计 + 排错",与前面的选择题概念辨析互补。代码题与第 2/8 节"加载模型"知识点呼应。

① 业务流程设计 · 图像数据采集流程设计

  • 一、确定采集目标:道路地面标线。
  • 二、确定采集方法:向相关部门申请数据;爬取数据(需遵守相关法律法规);自行采集(需向相关部门报批)。
  • 三、数据存储:将数据存储在网盘或硬盘等。

② 业务流程优化 · 数据审核流程优化

原方案问题:不能安排原标注人员审核数据量太大不能全部全样审核
  • 原方案:步骤(1) 原标注员全样审核,合格通过;步骤(2) 不合格则返工后重新执行(1)。
  • 优化方案
  • 步骤(1) 交叉抽样审核
  • 步骤(2) 合格则抽样数减半,不合格返工且抽样数翻倍,回到步骤1;
  • 步骤(3) 合格则审核通过,不合格返工且翻倍回到步骤1。
拓展(流程优化思路):
核心是把"全样审核"改为"交叉抽样 + 动态增减样本量"的闭环,既规避原标注员自评偏差,又用翻倍/减半机制控制质量与成本。与第 6 节"流程优化方式不包括配套方案设计"呼应。↩ 返回原文

③ 智能训练 a · 数据清洗规范

  • 清除错误数据
  • 清理模糊数据
  • 清除重复数据
  • 数据格式要统一
  • 数据命名要统一

④ 智能训练 b · 模型导入与算法评估(代码)

# 模型导入model = tf.keras.models.load_model('znxl005.h5')# 算法评估model.evaluate(test_image, test_label)# 运行终端打印出的日志:# 313/313 [==============================] - 6s 20ms/step - loss: 0.6782 - acc: 0.8139# 返回的数据列表:# [0.6782490611076355, 0.8138999938964844]
⛓ 与第 2 节 TensorFlow「tf.keras.models.load_model()」、第 8 节拓展②(加载模型操作题)直接呼应——本题就是该考点的实操落地。

⑤ 算法评估答案填空

  • 当前模型的分类数:10 类
  • 算法测试得到当前模型的 loss(损失):0.6782
  • 当前模型 acc(准确率):0.8139(约 81.4%)
acc 0.8139 对应日志 - acc: 0.8139;与第 3 节"准确率"概念一致。

⑥ 智能系统设计 a · 训练集与验证集不一致

现象原因(至少写两个):
  • 数据模型过于复杂
  • 训练数据不够
  • 训练数据错误
优化方案(至少写三种):
  • 降低数据模型复杂程度
  • 增加训练数据
  • 进行数据清洗:删除错误数据、处理缺失值、处理异常值、数据格式转换、数据标准化、去噪
拓展(排错思路):
训练/验证集表现不一致(过拟合或数据分布偏移)优先从"模型复杂度 + 数据量与质量"两端入手;数据清洗动作与第 5 节"缺失值处理/数据清洗"一致。↩ 返回原文

⑦ 人机交互 b · 模型导入与预测代码逻辑

# 3 模型导入model = tf.keras.models.load_model('znxtsj005.h5')# 4 设计预测 predict_fun() 函数def predict_fun(img): img = tf.expand_dims(img, 0) return model.predict(img)# 5 用 predict_fun() 预测指定的图片y1 = predict_fun(test_image[11]) print(class_label[np.argmax(y1)])
tf.expand_dims(img,0) 增加批维度;np.argmax(y1) 取最大概率类别索引——典型推理代码套路,面试/实操高频。

⑧ 试题 4 · 培训与指导

  • a) 培训流程排序(1 分):顺序为 ③ ⑤ ④ ① ②
    对应:③ 边框标注概论 → ⑤ 边框标注工具介绍 → ④ 边框标注质量标准 → ① 边框标注演示 → ② 边框标注实战
  • b) 指导反馈(4 分)· 数据集存在的问题:图片不清晰、图片重复、图片格式错误、采集错误数据。
实操题原文对照(浅色,仅作校对,不影响阅读)
实操题答案汇总 a 业务流程设计 第一题:图像数据采集流程设计 一、确定采集目标: 道路地面标线 二、确定采集方法: 向相关部门申请数据; 爬取数据,但需要遵守相关法律法规; 自行采集,但需要向相关部门报批。 三、数据存储: 将数据存储在网盘或者硬盘等。 b 业务流程优化 第二题:数据审核流程优化 原方案: 步骤(1):安排原标注员对数据标注结果进行全样审核,当数据合格时,审核通过; 步骤(2):当数据不合格时,让标注员返工,之后重新执行步骤(1)。 存在问题: 不能安排原标注人员进行审核 数据量太大不能全部都是全样审核 优化方案: 步骤(1):交叉抽样审核 步骤(2):合格则抽样数减半,不合格返工,抽样数量翻倍并重新回到步骤 1 步骤(3):合格则审核通过,不合格返工,抽样数量翻倍并重新回到步骤 1 智能训练 a 数据清洗规范: 清除错误数据 清理模糊数据 清除重复数据 数据格式要统一 数据命名要统一 智能训练 b # 模型导入 model = tf.keras.models.load_model('znxl005.h5') # 算法评估 model.evaluate(test_image, test_label) # 运行终端打印出的日志: # 313/313 [==============================] - 6s 20ms/step - loss: 0.6782 - acc: 0.8139 # 返回的数据列表: # [0.6782490611076355, 0.8138999938964844] 算法评估答案填空: 当前模型的分类数为: 10 类 算法测试得到当前模型的 loss(损失): 0.6782 当前模型 acc(准确率): 0.8139 智能系统设计 a 训练集与验证集不一致: 现象原因(至少写两个原因): 数据模型过于复杂 训练数据不够 训练数据错误 优化方案(至少写三种方案): 降低数据模型复杂程度 增加训练数据 进行数据清洗:删除错误数据,处理缺失值,处理异常值,数据格式转换,数据要标准化,去噪 人机交互 b 模型导入与预测代码逻辑: # 3 模型导入 model = tf.keras.models.load_model('znxtsj005.h5') # 4 设计预测 predict_fun()函数 def predict_fun(img): img = tf.expand_dims(img,0) return model.predict(img) # 5 用 predict_fun()函数预测指定的图片 y1 = predict_fun(test_image[11]) print(class_label[np.argmax(y1)]) 试题 4:培训与指导 a) 培训流程排序(1 分): 培训流程顺序为: ③ ⑤ ④ ① ② (对应顺序:③边框标注概论 -> ⑤边框标注工具介绍 -> ④边框标注质量标准 -> ①边框标注演示 -> ②边框标注实战) b) 指导反馈(4 分): 数据集存在的问题反馈: 图片不清晰 图片重复 图片格式错误 采集错误数据
实操题

实操题2(CSV 读取清洗 / 图像操作 / 算法测试流程)

围绕评论数据 comment.csv 的读取、清洗、统计与图像基础处理,以及算法测试标准流程图。

10 · 实操题2 详解

本组侧重 pandas 表格操作与 OpenCV 图像基础,与第 2 节「加载/处理数据」、第 6 节「数据清洗」知识点呼应。

① 读取与操作 CSV 文件(pandas)

# 读取 csv 文件comment_df = pd.read_csv('comment.csv')# 删除【评论】列为空的行comment_df = comment_df.dropna(subset=['评论'])# 3. 保存新表格,命名为 "2.1-comment_cleaned.csv"comment_cleaned_df.to_csv('./2.1-comment_cleaned.csv', index=False)
⛓ 核心方法:pd.read_csv() 读入、dropna(subset=...) 按列丢弃空值、to_csv(index=False) 写出且不保留行索引。

② 图像读取与处理(OpenCV / cv2)

# 读取图片img = cv2.imread('input.jpg')# 翻转图片(flipCode: 0 上下 / 1 左右 / -1 同时)flipped = cv2.flip(img, 1)# 放大图片(目标尺寸 (width, height))resized = cv2.resize(img, (800, 600))# 输出(保存)图片cv2.imwrite('output.jpg', resized)
⛓ 四个高频方法:cv2.imread 读、cv2.flip 翻转、cv2.resize 缩放、cv2.imwrite 写回。

③ 数据填充 / 统计 / 清洗(pandas)

  • 填充空值:conment_df['地区'].fillna('未知')
  • 求平均值:conment_df['评分'].mean()
  • 地区等于海外:conment_df['地区'] = '海外'
  • 删除数据中的 & 符号:conment_df['地区'] = conment_df['地区'].str.replace('&','')
  • 增加数据(追加行):conment_df = conment_df.append(xxx)
  • 个别空值填写 M:conment_df['列名'].fillna('M')
str.replace() 需经 .str 访问器(Series 字符串方法);append 向 DataFrame 末尾追加一行/多行。

④ 算法测试流程图

明确算法测试标准
算法测试集数据准备
挑选算法模型评估指标
算法功能测试
算法性能测试
算法指标结果分析
编写算法测试报告
按测试推进顺序:先定标准 → 备数据 → 选指标 → 功能测试 → 性能测试 → 结果分析 → 编写报告(圆圈序号为原题标号)。
理论题原文对照(浅色,仅作校对,不影响阅读)
泊松分布(Poisson Distribution):单位时间随机事件发生次数 二项:n 次试验成功次数;正态(高斯):连续测量值;卡方:统计检验 ========================= 减少操作步骤,提升操作效率:【高效性原则】 简洁:界面干净;一致:逻辑统一;容错:允许失误 ========================= HSV 彩色空间:H =【 色相】,S = 饱和度,V = 亮度 ========================= 关键词提取常用:【重点:SSA 不是关键词提取算法】。 **次要:TF-IDF、TextRank、LDA** ========================= 特征选择三类:**过滤式 Filter、包裹式 Wrapper、嵌入式 Embedded** =嵌入式 Embedded ==决策树 ===格式化数据 ==随机森林 ========================= 非结构化数据:图片、文本、音视频 适用手段:NLP、CV、神经网络、聚类也行(向量化后)、计算机视觉 决策树:擅长结构化表格数据 ======================== ==**召回:真的里面抓多少(查全率,防漏)** ==**精确:猜正的里面对多少(查准率,防误报)** ==**准确率:全部样本猜对比例** ==**F1:精确召回综合得分** 混淆矩阵维度:真实标签、预测标签(TP,以T为主) ======================== 损失函数 → 计算误差 → 反向传播 → 更新模型参数 准确率:只用来评估模型好坏,**不更新权重** ====================== **分类:预测类别(离散值)**,决策树、随机森林、SVM、逻辑回归 **回归:预测数值(连续值)**,线性回归 ======================== 超参数寻优(调参):网格搜索、随机搜索、贝叶斯优化 K-means、KNN:是模型算法,**不是调参方法** ================================ 新职业道德观念的核心理念:【服务意识】 增强职业道德可以【协调员工之间的关系】增强企业内部凝聚力。 ================================ =K 折交叉验证两大作用:**评估模型性能、选择最优模型** =点云基础信息:【三维坐标、颜色、反射强度】 ==纹理/距离,不是点云 =模型评价:产出评价结果 → 复核重审 → 确定后续方案 =按标注对象划分:**图像、文本、语音**三类。 =*:任意多个字符 =加班费【150%】 =接入网络可【多级】联接。 =以下哪项不是业务分析阶段需要识别的风险:【模型过拟合风险:**属于模型训练阶段才会出现的算法风险**】 =AdaGrad:累积梯度 → 分母变大 → **学习率持续减小** =AI 智能系统设计顺序:首先确认数据 → 业务需求 → 系统架构 → 算法开发 → UI 交互** =数据拆解【发现数据中的隐藏模式和趋势】 =机器标注算法对高层语义对象识别和【提取】效果不好。 =人工智能 (AI) ⊃ 机器学习 (ML) ⊃ 深度学习 (DL) =智能客服系统中,自然语言处理 (NLP) 的主要作用是【提供多语言支持】 =Fitts 定律(菲茨定律):用于预测用户的【点击速度】 =在使用TensorFlow进行AI模型测试时,如何加载已训练的模型?( )。使用tf.keras.models.load_model() ==TensorFlow:**支持分布式、TensorBoard 可视化、接口灵活;支持 GPU,不局限机器学习** =缺失值处理:删除、插补、变换 / 新增缺失标记 =流程优化方式不包括【配套方案设计】 =主观审核 = 【用户主观感受】 python 数组【输入】 =半结构化标注 = **标签值【结构化】 + 标签域【非结构化】** =数字、数据 属于数学语言 =【InVision】:**可交互原型、模拟产品体验** =【Adobe XD】:原型 Attention-OCR 的优点不包括【增强记忆功能】 。 ================================= - **预剪枝**:树长到一半,提前停止生长(边建边剪) - **后剪枝**:先生成完整大树,再从底部往上剪(建好再剪) 剪枝作用:**降低过拟合,提升泛化能力** ========================= 缓解过拟合手段: ✅训练**过程中**:Dropout、BN 层、L1/L2 正则 ✅训练**之前**:扩充数据集、数据增强、早停(及时停止)、降低模型复杂度 学习率:调整学习率主要是加快模型的训练速度 ======================= 随机抽取样本→缺少 【覆盖度】 ================================ **这个比较难理解** 1. **回归(预测连续数字)** - MSE (L2 均方损失)、MAE (L1 平均绝对损失) 2. **分类(预测类别)** - 交叉熵:深度学习分类最常用 - Hinge:SVM - 0-1 损失:理想分类损失,无法直接优化 =================================== = CNN = 卷积神经网络(跟图像有关) = RNN = 循环神经网络(时序 / 语音文本),LSTM 属于 RNN 变体 ==OCR(光学字符识别),CNN找出位置/检测,RNN 属于识别/提取阶段 =CTPN = OCR 文本检测经典模型;【是一个深度神经网络,使用多个卷积层】 = GAN = 生成对抗网络(组件有【判别器】) = Transformer:NLP 主流架构 = CRNN = 卷积循环神经网络是 OCR 文本识别经典模型,专门用来识别图片里单行不定长文本,**三段式结构**(考试高频) 1. 第一部分:【卷积层(CNN)【图像】】 2. 第二部分:【循环层(RNN / 双向 LSTM)【标签分布】】 3. 第三部分:【转录层【CTC 损失函数】把 RNN 输出的标签分布翻译成最终文本】 ============================ 跟华为有关的题目:都是芯片 选择无关的,一般都是界面友好度/精美度(有关的选这个) 文本情感分析在自然语言处理领域成为了研究中的一个分支。 ======================= ART = 对抗鲁棒性工具箱; TensorFlow/PyTorch 是训练框架,sklearn 传统机器学习库。 PyTorch 中负责自动微分的模块是什么?autograd ======================== **ModelArts(华为云一站式 AI 开发平台)** 图片目标标注默认:**矩形框(长方形)** 1. 完整 AI 链路:**数据管理 → 算法开发 → 模型训练 → 模型管理 → 部署上线** 2. 数据管理模块能力:数据集管理、数据标注、数据处理(清洗、增强、校验)没有【采集功能】 3. **AI Gallery**:配套资产集市,存放可复用模型、数据集、算子等 AI 资产(前面考题) 4. 特点:支持 PyTorch/TensorFlow/MindSpore;支持自动学习 AutoML;支持端边云一键部署 ===================== **A ❌ LDA 线性判别分析** 属于有监督降维,目标是**让不同类别尽可能分开** **B ✅ PCA 主成分分析(正确)** PCA 核心原理:对原始坐标轴做旋转变换,找到方差最大的新坐标轴(主成分),构造最优子空间;实现**降维,并且消除特征之间的相关性**,无监督。主成分分析(PCA),底层基于 SVD;随机 SVD 是 PCA 的优化变种 **C ❌ ICA 独立成分分析** 目标是把混合信号拆成互相**独立**的源信号 **D ❌ 特征识别** 不是降维算法,只是识别特征的过程。 ============= 池化层作用:缩小特征图(->减少神经网络模型的参数)、降低计算量、减少参数、一定程度防止过拟合。 梯度消失问题 → 靠 ReLU、残差网络、批量归一化 BN 解决。 --============= **A ✅ N-gram**:语言模型,常用于语音识别(ASR) **B ✅ RNN**:循环神经网络,可用于语音序列建模 **C ✅ ASRT**:开源语音识别工具库 **D ✅ LSTM**:RNN 的改进版本,擅长时序语音信号建模 **E ❌ CNN**:卷积神经网络多用于图像;**不属于邀约机器人语音识别模块的常规组成** ======================== 深度学习 **A ✅ Word2Vec**:词向量模型 **B ✅ Transformer**:深度学习基础架构 **C ✅ BERT**:基于 Transformer 的预训练语言模型 **D ❌ K-means**:聚类算法,属于无监督机器学习,**不属于深度学习** **E ❌ 决策树**:传统机器学习算法,不是深度学习技术。 ✅数据预处理:清洗、集成、变换、规约 ❌数据建模任务:分类、回归、聚类 =监督学习:已有标注数据集,学习输入→标签映射 → 逻辑回归(分类)、KNN近邻算法、神经网络、监督学习 ==分类(Classification):监督学习。预测变量是离散的类别标签 ==回归(Regression):监督学习。预测变量是连续的数值 =无监督学习:无标签 → 聚类(只是把一堆对象【集合分组】)、降维\K-means\谱聚类 ==聚类(Clustering):无监督学习。【同类均值插补】 强化学习:智能体交互环境,靠奖励信号学习策略 ========================================= 启发式评估是一种由专家根据预设的可用性原则对界面进行快速评估的方法,它不需要用户参与 AutoML(自动机器学习)可以自动完成特征工程、模型选择、超参调优等步骤,并非【完全不需要人工干预】。 文本数据标注需要遵循一定的质量标准->错。 全连接神经网络是神经网络模型中的一种 管理者识别需求要利用信息支持评审过程输入、过程输出(错误,识别需求是挖掘业务目标) 数据平滑 ≠ 去除噪声 特征工程中,为了处理分类数据中的类别不平衡问题【使用 SMOTE(合成少数类过采样技术)】 Python传统机器学习算法:【Scikit-learn】【非常适合表格结构化数据】 【Pandas 】表格数据分析。 数据变换:【将数据转变为符合要求的形式】 数据清洗:【提升数据质量】 【mAP 】平均精度均值(mean Average Precision) 决策树的叶节点是【决策的结果】 【YOLO 】是目标检测(物体识别)经典算法。 【Sigmoid】极易梯度消失

编辑页面
分享这篇文章:

上一篇
欢迎来到 ZHX NEXUS Studio