(通讯员 杨亚明) 西电智能媒体与数据工程研究所长期致力于数据挖掘与数据工程领域的研究工作。近期,研究所在该研究领域的国际顶级会议、CCF A类会议ICDE 2025(41th IEEE International Conference on Data Engineering)发表三项研究成果。
研究成果一:Privacy-Preserving Approximate Nearest Neighbor Search on High-Dimensional Data
在云计算和人工智能时代,数据所有者将向量数据外包给云端,而云端则为用户提供近似k-最近邻(k-ANNS)服务。为了防止数据隐私被不可信的服务器泄露,向量上的隐私保护k-ANNS(PP-ANNS)已经成为一个基础且迫切的问题。然而,现有的PP-ANNS方案无法同时满足数据隐私、效率、准确性和最小化用户参与度的要求。为了解决这一挑战,本文提出了一种新的解决方案,该方案主要在单个云服务器上执行PP-ANNS,以避免云和用户之间的通信开销。为了确保数据隐私,本文引入了一种名为距离比较加密的新颖加密方法,进行安全、高效且精确的距离比较。为了平衡数据隐私和搜索性能,本文设计了一种结合k-ANNS方法和近似距离计算方法的隐私保护索引。之后,基于该索引设计了一种基于过滤-精炼策略的搜索方法。此外,本文对所提出的方案进行了安全性分析。根据实验结果,与现有方法相比,本文的方法在不牺牲精确性的同时,加速PP-ANNS达三个数量级以上。
该论文第一作者是研究所数据库团队刘英帆博士,第一学生作者是硕士生张艳弟,通讯作者是李辉教授,由谢嘉东、Jeffrey Xu Yu教授和崔江涛教授共同完成。

研究成果二:Indexing Labeled Property Multidigraphs in Entropy Space With Applications
在线图数据的激增例如社交网络和引文网络所产生的数据,需要空间高效的图索引方法,以支持快速图查询和图分析。标签属性多重图作为表示复杂图数据的模型在实际中被广泛使用。然而,压缩和索引标签属性多重图的基本问题仍未解决。
本文专注于静态数据,首次建立了标签属性多重图的熵压缩表示模型,提出了一种压缩和索引标签属性多重图的新型自索引CGraphIndex。该自索引首次达到了多重图属性的高阶熵空间压缩(实际中的控制项)和多重图结构的一阶图熵。自索引实际上对原始输入进行编码,因此无需单独存储输入数据。CGraphIndex支持常量时间内在结构和属性上进行基本和导航操作,并支持对顶点属性和边属性的快速提取。在大型LDBC SNB SF1000基准数据上的实验表明,对于比较的交互式复杂查询、商业智能查询以及典型的图分析BFS和PageRank,CGraphIndex的空间占用和查询时间均显著优于流行的图数据库系统如Neo4j(社区版)。CGraphIndex的查询时间通常快若干数量级,同时空间占用降低了数倍。
该论文第一作者是研究所霍红卫教授,学生作者是俞泳泽和何宗涛,通讯作者是霍红卫和合作者Jeffrey S. Vitter教授。

研究成果三:A Translation-based Heterogeneous Graph Neural Network for Multiple Knowledge Graphs Alignment
知识图谱对齐任务旨在融合不同来源的知识图谱,以期实现更全面的知识获取与信息融合。现有方法主要分为两类,一种是基于翻译语义的方法,另一种是基于图神经网络的方法,它们通常将实体和关系投影到一个低维嵌入空间中来解决这一问题,分别具有各自的优势。然而,很少有研究工作考虑建模知识图谱中不同阶数的翻译语义。为此,本文提出了一种新颖的知识图谱编码器KG2HIN,将头实体、关系以及尾实体看作三种类型的节点,从而将知识图谱转化为异构图。KG2HIN通过结合异构图神经网络中的聚合算子以及传统知识图谱嵌入方法中的翻译算子,能够自适应地学习不同阶数翻译语义的重要性。在KG2HIN编码器的基础上,进一步构建了一个图神经网络模型,并将其用于同时对齐多个(超过两个)知识图谱。与现阶段最优的基线方法相比,KG2HIN在DBP-4数据集上的M-Hits@1(准确率)从10.25%显著提升至73.05%,在DWY-3数据集上从41.19%提升至97.81%,同时大幅减少了模型参数量和训练时间。
该论文第一作者是研究所智能媒体计算团队杨亚明博士,第一学生作者是计算机科学与技术学院本科三年级学生罗卓峰,通讯作者是管子玉教授,由赵伟教授等共同完成。
