在Kotlin开发里,比对两个数组内容差异是常见任务,比如同步本地与远端数据、找出被删除或新增的记录。直接使用双重循环虽然直观,但时间复杂度高,代码也不够简洁。借助Kotlin与Java集合框架,可以用更少代码完成这件事。
基于集合运算符的基础方案
Kotlin的数组类型提供了toSet方法,能够将数组转换为不可变集合。集合类型重载了减法运算符minus与交集运算符intersect,利用它们可以一行代码求出差异。这种方式代码可读性最好,适合数据量不大、对性能要求不极端的场景。
下面的示例展示如何找出在数组a中但不在数组b中的元素,以及反向差异。注意toSet会去重,如果原数组存在重复元素且需要保留次数差异,这种写法会丢失信息。
fun main() {
val a = arrayOf(1, 2, 3, 4, 5)
val b = arrayOf(3, 4, 5, 6, 7)
// 仅存在于a中的元素
val onlyInA = a.toSet() - b.toSet()
// 仅存在于b中的元素
val onlyInB = b.toSet() - a.toSet()
println(onlyInA) // [1, 2]
println(onlyInB) // [6, 7]
}
使用HashSet提升大数据量性能
当数组长度达到数万或更多时,反复调用toSet与减法会产生较多中间集合。更高效的办法是手动将其中一组放入HashSet,然后遍历另一组做包含判断。HashSet的contains方法接近常数时间,整体复杂度从嵌套循环的O(n*m)降为O(n+m)。
以下代码演示用HashSet计算双向差异,并保留原数组顺序。我们先将b的元素装入集合,再过滤a得到独有项,反之亦然。这种写法在实时比对、批处理任务中更稳妥。
fun diffLargeArrays(a: Array<Int>, b: Array<Int>): Pair<List<Int>, List<Int>> {
val setB = b.toHashSet()
val onlyInA = a.filter { it !in setB }
val setA = a.toHashSet()
val onlyInB = b.filter { it !in setA }
return onlyInA to onlyInB
}
fun main() {
val a = Array(100000) { it }
val b = Array(100000) { it + 50000 }
val (left, right) = diffLargeArrays(a, b)
println(left.size) // 50000
println(right.size) // 50000
}
自定义对象的差异比较
如果数组存放的是自定义类实例,集合运算依赖equals与hashCode。若未正确重写,对象将按引用比较,导致明明内容相同的元素被判为不同。应在数据类中声明属性,Kotlin的data class会自动生成这两个方法。
下面定义一个User数据类,并以id作为区分依据。将其数组转为集合后做减法,能够准确找出新增或移除的用户。若使用普通class而未重写方法,结果就会出错,这是实际项目中容易踩的坑。
data class User(val id: Int, val name: String)
fun main() {
val oldUsers = arrayOf(User(1, "Tom"), User(2, "Jane"))
val newUsers = arrayOf(User(2, "Jane"), User(3, "Bob"))
val added = newUsers.toSet() - oldUsers.toSet()
val removed = oldUsers.toSet() - newUsers.toSet()
println(added) // [User(id=3, name=Bob)]
println(removed) // [User(id=1, name=Tom)]
}
需要保留重复元素的场景
前面方案都基于集合去重特性,如果业务要求统计出现次数差异,例如数组a有两个1而b有一个1,希望得出剩余一个1,就需要用mutableMapOf计数。遍历第一个数组增加计数,遍历第二个减少,最后留下正数项即为差异。
这种计数法兼顾了重复元素与性能,不需要多次生成集合。下面的示例封装为函数,返回左侧相对右侧的多余元素列表,可按需扩展为双向计数映射。
fun countDiff(a: Array<String>, b: Array<String>): List<String> {
val freq = mutableMapOf<String, Int>()
a.forEach { freq[it] = freq.getOrDefault(it, 0) + 1 }
b.forEach { freq[it] = freq.getOrDefault(it, 0) - 1 }
val result = mutableListOf<String>()
freq.forEach { (k, v) ->
repeat(v) { result.add(k) }
}
return result
}
fun main() {
val a = arrayOf("x", "x", "y")
val b = arrayOf("x", "z")
println(countDiff(a, b)) // [x, y]
}
方案选择与总结
对于绝大多数后台或客户端业务逻辑,数据量较小且无需关注重复次数时,直接用toSet配合减号最省心。面对大数组或高频调用,应改用HashSet过滤。涉及对象比较务必保证equals与hashCode正确。只有统计频次差异时才引入计数映射。
理解这些写法的底层开销与适用边界,能让你在代码评审或性能优化时快速定位不合理比对逻辑,写出既简洁又高效的Kotlin数组差异处理代码。