均衡版 KMeans 分群与新用户归类

均衡版 KMeans 分群与新用户归类

https://www.nowcoder.com/practice/78c6d3b75b214175846f87040c2f163c

均衡版 KMeans 分群与新用户归类

题目分析

给定 位客户的 维特征向量,使用均衡版 KMeans 将其划分为 个群组,每组容量严格均衡(),迭代至收敛后,对新客户进行归类。

思路

模拟均衡 KMeans 聚类

与标准 KMeans 不同,本题要求每个簇的容量严格均衡,因此分配阶段需要加入容量限制。

初始化:取前 个客户的特征作为初始质心。容量分配为:前 个质心容量为 ,其余为

分配阶段:按客户编号 顺序处理。对每个客户,计算到所有未满员质心的平方欧氏距离,选距离最小的质心(并列选编号小的)。

更新阶段:每个质心更新为该簇内所有成员特征的逐维均值向下取整

收敛判断:若本轮的分配结果和质心与上一轮完全一致,则停止迭代。

新用户归类:将最终质心按字典序排序,计算新客户到各质心的平方欧氏距离,选最近的质心(并列选字典序最小的),输出其在排序列表中的位置(1-indexed)。

关键细节:

  • 距离使用平方欧氏距离,避免浮点误差。
  • 质心更新使用整数除法向下取整,因此质心始终是整数,收敛判断可以直接比较。
  • 容量限制使得分配顺序会影响结果,必须按客户编号顺序处理。

代码

import sys

def main():
    data = sys.stdin.read().split()
    idx = 0
    N = int(data[idx]); idx += 1
    M = int(data[idx]); idx += 1
    K = int(data[idx]); idx += 1

    customers = []
    for i in range(N):
        feat = []
        for j in range(M):
            feat.append(int(data[idx])); idx += 1
        customers.append(feat)

    new_cust = []
    for j in range(M):
        new_cust.append(int(data[idx])); idx += 1

    centers = [list(customers[i]) for i in range(K)]

    base = N // K
    extra = N % K
    caps = [base + 1 if i < extra else base for i in range(K)]

    def sq_dist(a, b):
        s = 0
        for i in range(M):
            d = a[i] - b[i]
            s += d * d
        return s

    prev_assign = None
    prev_centers = None

    while True:
        assign = [[] for _ in range(K)]
        filled = [0] * K
        assignment = [0] * N

        for ci in range(N):
            best_center = -1
            best_dist = -1
            for ki in range(K):
                if filled[ki] >= caps[ki]:
                    continue
                d = sq_dist(customers[ci], centers[ki])
                if best_center == -1 or d < best_dist:
                    best_dist = d
                    best_center = ki
            assign[best_center].append(ci)
            filled[best_center] += 1
            assignment[ci] = best_center

        new_centers = []
        for ki in range(K):
            nc = []
            for j in range(M):
                s = sum(customers[ci][j] for ci in assign[ki])
                nc.append(s // len(assign[ki]))
            new_centers.append(nc)

        if assignment == prev_assign and new_centers == prev_centers:
            centers = new_centers
            break
        prev_assign = assignment
        prev_centers = new_centers
        centers = new_centers

    sorted_centers = sorted(centers)
    out = []
    for c in sorted_centers:
        out.append(' '.join(map(str, c)))

    best_idx = -1
    best_dist = -1
    for i, c in enumerate(sorted_centers):
        d = sq_dist(new_cust, c)
        if best_idx == -1 or d < best_dist or (d == best_dist and c < sorted_centers[best_idx]):
            best_dist = d
            best_idx = i
    out.append(str(best_idx + 1))
    sys.stdout.write('\n'.join(out) + '\n')

main()

复杂度分析

  • 时间复杂度,其中 为迭代轮数。每轮对 个客户计算到 个质心的 维距离。由于质心取整,收敛通常很快。
  • 空间复杂度,存储客户特征和质心。
全部评论

相关推荐

昨天 08:58
已编辑
门头沟学院 Java
ttl:&nbsp;3.19一面晚上过3.20二面3.23oc3.25offerbase:末9有一段中小厂实习一面面经:(总体时长一个小时二十分钟左右没什么八股,主要都是问项目和场景题1.实习(问了有四十分钟,感觉面试官很看重实习这一块,一直在拷打,问到后面我都要疯了,好在准备得比较充分1️⃣用的是什么中间件,有参与技术选型吗,实习的项目里为什么选这个RabbitMQ而不是kafka,为什么不用RocketMQ,为什么放弃异步,自己的项目里面使用的是kafka,那你觉得项目和实习的中间件选型有差异的原因是什么,他们之间的区别在哪里,底层的原因知道吗(高柱到这里已经快疯了,但是硬着头皮答完了,主要是从一致性吞吐量和框架的契合度答,面试官说答得挺好的,应该是没什么问题,这一块就问了快半个小时,到这里我已经快疯了2️⃣项目怎么对接上下游3️⃣介绍项目的难点重点4️⃣微服务(高柱实习是单体项目没涉及这一块5️⃣Redis的使用2.项目:1️⃣智能客服是怎么应用在项目里的(langchain4j➕rag➕functioncalling)2️⃣RAG了解多少3️⃣文本向量化的难点是什么,了解哪些大模型的知识(我一点不懂,纯瞎扯,但貌似扯对了4️⃣对ai的态度是什么,aicoding相关5️⃣怎么保证多节点下Caffeine缓存里面数据都是一致的(答的是短ttl,面试官不是很满意,但是我确实不太懂这个怎么保证,后来查了还是不懂怎么保证6️⃣Redis的使用,和你的实习项目的使用有区别吗,还有一些引申问题3.八股(含量不高,就是走个过场1️⃣进程的内存布局2️⃣Redis三剑客3️⃣微服务相关知识(高柱已经忘得差不多了…勉强答上来4️⃣JVM5️⃣线程状态6️⃣线程安全,在你的实习项目里怎么保证线程安全的(又绕回来了4.智商题找异常球5.手撕:1️⃣五道sql,不难2️⃣力扣不重叠的滑动窗口数组,贪心➕双指针秒了强度拉满了这个一面,高柱到后面人都是傻的二面面经:(就半个小时实习拷打,简历上写了几点就问了几点,问完就结束了,无手撕
查看19道真题和解析
点赞 评论 收藏
分享
评论
点赞
收藏
分享

创作者周榜

更多
牛客网
牛客网在线编程
牛客网题解
牛客企业服务