|
|
@@ -54,7 +54,6 @@ def execute_odps_sql(sql) -> bool:
|
|
|
_STRATEGY_GAP = "当下供需gap"
|
|
|
_STRATEGY_GAP_FENCI = "当下供需gap-分词"
|
|
|
_STRATEGY_GAP_ZAOAN = "当下供需gap-早安"
|
|
|
-_ZAOAN_BARE_DEMAND_NAMES = {"早安", "晨安", "早上好", "清晨", "晨起"}
|
|
|
_HIVE_TABLE = "loghubods.dwd_multi_demand_pool_di"
|
|
|
_HIVE_DT_FMT = "%Y%m%d" # 分区格式:yyyymmdd,如 20260519
|
|
|
_CHINA_TZ = ZoneInfo("Asia/Shanghai")
|
|
|
@@ -287,8 +286,7 @@ def write_dwd_multi_demand_pool_di_to_hive(rows: list[dict]) -> int:
|
|
|
def write_dwd_zaoan_demand_pool_to_hive(rows: list[dict]) -> int:
|
|
|
"""
|
|
|
写入策略「当下供需gap-早安」到 loghubods.dwd_multi_demand_pool_di。
|
|
|
- 固定早安词(早安/晨安/早上好/清晨/晨起)demand_name 只用词本身,不拼品类。
|
|
|
- 其余 demand_name = merge_leve2 + ' ' + name。
|
|
|
+ demand_name 只用需求词本身,不拼品类。
|
|
|
demand_id = md5(strategy + demand_name + type + dt)
|
|
|
该策略已由上游筛过,不再套用过滤词 / 昨天分词去重。
|
|
|
"""
|
|
|
@@ -314,7 +312,7 @@ def write_dwd_zaoan_demand_pool_to_hive(rows: list[dict]) -> int:
|
|
|
video_count = len(video_ids)
|
|
|
extend_json = json.dumps({"品类": merge_leve2}, ensure_ascii=False)
|
|
|
|
|
|
- demand_name = name if name in _ZAOAN_BARE_DEMAND_NAMES else f"{merge_leve2} {name}"
|
|
|
+ demand_name = name
|
|
|
demand_id = hashlib.md5(
|
|
|
f"{_STRATEGY_GAP_ZAOAN}{demand_name}{type_str}{china_today}".encode("utf-8")
|
|
|
).hexdigest()
|