既可以保留数据内在信息又可以降低数据复杂性和维度的合适特征表示是机器学习模型性能的关键。持久同源性 (PH) 深深植根于代数拓扑学中,在数据简化和本征结构表征之间提供了微妙的平衡,并已成功应用于各个领域。然而,PH和机器学习的结合受到三个挑战的极大阻碍,即数据的拓扑表示、基于PH的距离测量或度量以及基于PH的特征表示。随着拓扑数据分析的发展,这三个问题都取得了进展。我们从计算的角度对PH和基于PH的监督和无监督模型进行了系统综述。我们重点研究数学模型和工具的最新发展,包括 PH 软件和基于 PH 的函数、特征表示、内核和相似性模型。从本质上讲,这可以作为基于PH的机器学习工具实际应用的路线图。此外,我们比较了两种类型的简单复合物(alpha 和 Vietrois-Rips 复合物)、两种类型的特征提取(条形码统计和分箱特征)和三种类型的机器学习模型(支持向量机、基于树的模型和神经网络),并研究了它们对蛋白质二级结构分类的影响。