摘要: 有向无环图(DAG)是一种图论结构,由顶点和有向边组成,且不包含任何有向环。它天然定义了偏序关系,允许一个子节点拥有多个父节点(多继承性),比树结构更具表达能力。在生物信息学中,DAG是基因本体论(GO)的核心数据结构,用于表示术语间的“is a”和“part of”关系,支持高效的语义推理。在计算机科学中,DAG广泛应用于任务调度(拓扑排序)、版本控制(如Git)、数据流编程和动态规划。核心算法包括线性时间内的拓扑排序、最长/最短路径求解及可达性分析。DAG因无环特性,避免了循环依赖,成为建模[阅读全文:]
摘要: 批次效应(Batch effect)是指在高通量组学实验中,由于非生物学的技术性因素(如样本制备、检测平台、操作者、环境条件等)在不同实验批次间引入的系统性变异。这种变异叠加在真实生物学信号上,可能导致数据不可重复和错误发现。批次效应具有系统性、非生物学来源、可叠加性和普遍性等特征,常见于微阵列、RNA测序、蛋白质组学和代谢组学等研究。识别方法包括主成分分析(PCA)和层次聚类热图等无监督工具,以及方差分析等有监督方法。校正策略分为实验设计阶段的预防(随机化、平衡设计、引入对照)和数据分析阶段的[阅读全文:]
摘要: 细胞组件是基因本体论三大分支之一,用于描述基因产物在细胞内执行功能时的具体位置或结构环境。它涵盖从亚细胞器、大分子复合物到膜结构域、细胞骨架成分及细胞外区域等不同层次的定位信息。术语被组织成有向无环图,通过'is a'和'part of'关系连接。该本体在基因产物定位注释、功能富集分析、细胞功能研究及疾病机制探讨中具有重要应用。尽管存在动态定位、精确性不足等挑战,细胞组件本体仍是整合生物学数据、理解细胞功能的核心工具。[阅读全文:]
摘要: 基因本体论(Gene Ontology, GO)是一个全球广泛使用的标准化生物信息学资源与知识库,旨在统一描述任何生物体中基因及其产物(如蛋白质、非编码RNA)的功能。GO由三个独立但相互关联的本体组成:细胞组件(CC)、分子功能(MF)和生物学过程(BP)。GO术语以有向无环图(DAG)结构组织,具有标准化标识符和明确的语义关系。GO的核心应用包括基因功能注释和功能富集分析,后者通过统计检验识别在特定基因集中显著富集的功能类别。GO由基因本体论联盟维护,可通过官网及多种生物信息学工具获取。GO[阅读全文:]
摘要: 差异表达分析(DEA)是基因表达分析中用于识别不同生物学条件下表达水平显著变化的基因的核心统计过程。其目标是从高通量数据(如RNA-Seq或微阵列)中区分真实生物学变异与技术噪声。分析流程包括数据预处理(标准化)、基于负二项分布等模型的统计建模、多重检验校正(如FDR控制)及结果筛选。主流工具包括DESeq2、edgeR、limma-voom等,各有特点。挑战包括生物学重复的必要性、批次效应、异方差性及低表达基因处理。下游分析涉及功能富集、聚类、网络分析等。DEA广泛应用于疾病机制研究、生物标志[阅读全文:]
摘要: 基因表达分析是功能基因组学和系统生物学的核心手段,通过测量细胞或组织中基因的活性(表达水平),揭示发育、疾病、环境刺激等条件下的基因调控模式。主要技术包括转录组水平的微阵列、RNA测序和qRT-PCR,蛋白质组学质谱法,以及基因敲除等功能验证方法。RNA-Seq作为金标准,其分析流程涵盖实验设计、序列比对、定量标准化、差异表达分析及功能富集等步骤。该领域广泛应用于基础生物学、疾病标志物发现、药物开发、精准医学和农业科学。当前前沿包括单细胞RNA测序、空间转录组学、多组学整合及人工智能应用。[阅读全文:]
摘要: 层次聚类分析(Hierarchical clustering analysis, HC)是一种无监督机器学习方法,通过构建嵌套的簇层次结构来揭示数据内在分组模式。主要分为凝聚式(自底向上合并)和分裂式(自顶向下分裂)两种策略,前者更为常见。算法核心包括距离矩阵计算、簇间连接准则(单连接、全连接、平均连接、沃德法)的选取,输出通常以树状图(dendrogram)可视化。该方法广泛应用于基因表达分析、系统发育学、文本聚类、市场细分和化学信息学等领域。优点在于无需预设簇数、提供层次可视化,但计算复杂度[阅读全文:]
摘要: 系统发育树(Phylogenetic tree),又称进化树,是系统发育学中用于表示生物实体(如物种、基因、蛋白质等)之间进化关系的分支树状图。其核心结构包括节点(代表共同祖先或分支事件)和分支(代表进化谱系),可呈现有根或无根两种主要类型。构建方法涵盖距离法(如邻接法)、最大简约法、最大似然法和贝叶斯推断法,常用分子数据(DNA、RNA、蛋白质序列)经多序列比对后分析。系统发育树在揭示生命之树、分类学、进化过程研究、分子钟定年、病原体追踪及功能基因组学等领域有广泛应用,但也面临长枝吸引、不完全[阅读全文:]
摘要: 树状图(Dendrogram)是一种用于展示层次聚类关系的树形结构图,广泛应用于统计学、生物信息学、系统发育学和数据挖掘等领域。其核心结构包括叶子节点(原始数据点)、内部节点(聚合簇)和根节点(最终聚合簇),分支长度通常表示对象间的距离或不相似度。树状图主要分为纵向和横向两种类型,可通过层次聚类分析构建,步骤包括定义距离矩阵、选择连接方法(如单连接、全连接、平均连接和沃德法)、迭代聚合和绘制图形。解读时可通过纵向阅读观察聚合过程,通过分支长度判断相似性,并通过水平切割确定簇数。树状图具有直观性强[阅读全文:]
摘要: 热图是一种以颜色编码矩阵数据的可视化技术,通过冷色至暖色的过渡表示数值大小,广泛应用于生物信息学、统计学、地理信息系统、用户行为分析和商业智能等领域。其核心要素包括数据矩阵、颜色映射、聚类分析和辅助信息。创建热图的关键步骤包括数据标准化、颜色方案选择、聚类算法应用及绘图注释。常用工具包括R语言的pheatmap、ComplexHeatmap,Python的seaborn、matplotlib,以及在线工具Morpheus等。解读时需注意颜色选择、聚类方法、标准化方式可能带来的误导。热图在基因表达[阅读全文:]