video_discovery.py 10 KB

123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113114115116117118119120121122123124125126127128129130131132133134135136137138139140141142143144145146147148149150151152153154155156157158159160161162163164165166167168169170171172173174175176177178179180181182183184185186187188189190191192193194195196197198199200201202203204205206207208209210211212213214215216217218219220221222223224225226227228229230231232233234235236237238239240241242243244245246247248249250251252253254255256257258259260261262263264265266267268269270271272273274275276277278279280281282283284285286287288289290291292293294295296297298299300301302303304305306307308309310311312313314315
  1. """Demand-first video discovery data for the web workspace."""
  2. from __future__ import annotations
  3. import json
  4. from typing import Any
  5. from supply_infra.db.repositories.demand_feedback_repo import DemandFeedbackRepository
  6. from supply_infra.db.repositories.demand_grade_repo import DemandGradeRepository
  7. from supply_infra.db.repositories.demand_video_expansion_repo import (
  8. DemandVideoExpansionRepository,
  9. )
  10. from supply_infra.db.repositories.global_tree_category_repo import (
  11. GlobalTreeCategoryRepository,
  12. )
  13. from supply_infra.db.repositories.multi_demand_video_detail_repo import (
  14. MultiDemandVideoDetailRepository,
  15. )
  16. from supply_infra.db.repositories.pipeline_step_run_repo import PipelineStepRunRepository
  17. from supply_infra.db.session import get_session
  18. _POINT_TYPES = {"inspiration", "purpose", "key"}
  19. _SOURCE_VIDEO_GRADES = frozenset({"B", "C", "D"})
  20. _VIDEO_DETAIL_URL_TEMPLATE = "https://admin.piaoquantv.com/cms/post-detail/{vid}/detail"
  21. def _parse_video_ids(raw: Any) -> list[str]:
  22. """Parse JSON array or comma-separated text into ordered unique vid list."""
  23. if raw is None:
  24. return []
  25. items: list[Any]
  26. if isinstance(raw, str):
  27. text = raw.strip()
  28. if not text:
  29. return []
  30. try:
  31. parsed = json.loads(text)
  32. except (TypeError, ValueError):
  33. parsed = None
  34. if isinstance(parsed, list):
  35. items = parsed
  36. elif parsed is not None:
  37. items = [parsed]
  38. else:
  39. items = [part.strip() for part in text.split(",")]
  40. elif isinstance(raw, (list, tuple)):
  41. items = list(raw)
  42. else:
  43. return []
  44. result: list[str] = []
  45. seen: set[str] = set()
  46. for item in items:
  47. vid = str(item).strip() if item is not None else ""
  48. if vid and vid not in seen:
  49. seen.add(vid)
  50. result.append(vid)
  51. return result
  52. def _normalize_url(value: Any) -> str | None:
  53. if value is None:
  54. return None
  55. text = str(value).strip()
  56. return text or None
  57. def _serialize_video(
  58. video_id: str,
  59. detail: Any | None,
  60. points: list[dict[str, Any]],
  61. feedback_count: int = 0,
  62. ) -> dict[str, Any]:
  63. url1 = _normalize_url(detail.url1) if detail else None
  64. url2 = _normalize_url(detail.url2) if detail else None
  65. return {
  66. "vid": video_id,
  67. "title": detail.title if detail else None,
  68. "url1": url1,
  69. "url2": url2,
  70. "video_detail_url": _VIDEO_DETAIL_URL_TEMPLATE.format(vid=video_id),
  71. "point_count": len(points),
  72. "points": points,
  73. "feedback_summary": {"count": int(feedback_count)},
  74. }
  75. def _source_video_count(row: Any, expansion_counts: dict[int, int]) -> int:
  76. grade = str(row.grade or "").upper()
  77. if grade in _SOURCE_VIDEO_GRADES:
  78. return len(_parse_video_ids(row.video_list))
  79. return expansion_counts.get(int(row.id), 0)
  80. def _parse_string_list(raw: Any) -> list[str]:
  81. """Parse JSON arrays and legacy comma-separated text into a stable string list."""
  82. if raw is None:
  83. return []
  84. values: list[Any]
  85. if isinstance(raw, str):
  86. text = raw.strip()
  87. if not text:
  88. return []
  89. try:
  90. parsed = json.loads(text)
  91. except (TypeError, ValueError):
  92. parsed = None
  93. if isinstance(parsed, list):
  94. values = parsed
  95. elif parsed is not None:
  96. values = [parsed]
  97. else:
  98. values = [part.strip() for part in text.split(",")]
  99. elif isinstance(raw, (list, tuple)):
  100. values = list(raw)
  101. else:
  102. values = [raw]
  103. result: list[str] = []
  104. seen: set[str] = set()
  105. for value in values:
  106. text = str(value).strip() if value is not None else ""
  107. if text and text not in seen:
  108. seen.add(text)
  109. result.append(text)
  110. return result
  111. def _parse_int_list(raw: Any) -> list[int]:
  112. result: list[int] = []
  113. for value in _parse_string_list(raw):
  114. try:
  115. result.append(int(value))
  116. except ValueError:
  117. continue
  118. return result
  119. def _number(value: Any) -> float | None:
  120. return float(value) if value is not None else None
  121. def _serialize_demand(
  122. row: Any,
  123. category_names: dict[int, str],
  124. video_count: int,
  125. feedback_count: int = 0,
  126. ) -> dict[str, Any]:
  127. category_ids = _parse_int_list(row.category_ids)
  128. return {
  129. "id": int(row.id),
  130. "demand_name": row.demand_name,
  131. "biz_dt": str(row.biz_dt),
  132. "grade": row.grade,
  133. "score": _number(row.score),
  134. "prior_total_score": _number(row.prior_total_score),
  135. "posterior_rov_avg": _number(row.posterior_rov_avg),
  136. "posterior_rov_count": int(row.posterior_rov_count or 0),
  137. "has_posterior": bool(row.has_posterior),
  138. "category_ids": category_ids,
  139. "category_names": [
  140. category_names[category_id]
  141. for category_id in category_ids
  142. if category_id in category_names
  143. ],
  144. "strategies": _parse_string_list(row.strategies),
  145. "reason": row.reason,
  146. "video_count": video_count,
  147. "feedback_summary": {"count": int(feedback_count)},
  148. }
  149. def _category_name_map(session: Any, rows: list[Any]) -> dict[int, str]:
  150. category_ids = sorted(
  151. {
  152. category_id
  153. for row in rows
  154. for category_id in _parse_int_list(row.category_ids)
  155. }
  156. )
  157. categories = GlobalTreeCategoryRepository(session).list_active_by_ids(category_ids)
  158. return {
  159. int(category.id): str(category.name)
  160. for category in categories
  161. if category.name
  162. }
  163. _DEMAND_EXPAND_STEP_KEY = "demand_expand"
  164. def _resolve_video_discovery_biz_dt(session: Any, biz_dt: str | None) -> str | None:
  165. """默认取最近一次成功完成的 demand_expand 步骤所属业务日。"""
  166. if biz_dt:
  167. return str(biz_dt)
  168. latest_expand_dt = PipelineStepRunRepository(session).get_latest_succeeded_biz_dt(
  169. _DEMAND_EXPAND_STEP_KEY
  170. )
  171. if latest_expand_dt:
  172. return latest_expand_dt
  173. return DemandGradeRepository(session).get_latest_biz_dt()
  174. def list_video_discovery_demands(biz_dt: str | None = None) -> dict[str, Any]:
  175. """Return one demand card per demand_grade row for the selected/latest day."""
  176. with get_session() as session:
  177. grade_repo = DemandGradeRepository(session)
  178. resolved_biz_dt = _resolve_video_discovery_biz_dt(session, biz_dt)
  179. if not resolved_biz_dt:
  180. return {"biz_dt": None, "items": []}
  181. rows = grade_repo.list_by_biz_dt(str(resolved_biz_dt))
  182. category_names = _category_name_map(session, rows)
  183. video_counts = DemandVideoExpansionRepository(
  184. session
  185. ).count_distinct_videos_by_demand_grade(str(resolved_biz_dt))
  186. feedback_counts = DemandFeedbackRepository(session).count_demands(
  187. [int(row.id) for row in rows]
  188. )
  189. return {
  190. "biz_dt": str(resolved_biz_dt),
  191. "items": [
  192. _serialize_demand(
  193. row,
  194. category_names,
  195. _source_video_count(row, video_counts),
  196. feedback_counts.get(int(row.id), 0),
  197. )
  198. for row in rows
  199. ],
  200. }
  201. def get_video_discovery_demand(demand_grade_id: int) -> dict[str, Any] | None:
  202. """
  203. Resolve the judged video list and hit evidence from demand_video_expansion.
  204. S/A 使用拓展命中视频;B/C/D 使用 demand_grade.video_list 中的源视频。
  205. multi_demand_video_detail 补充 title 与解构 url1/url2。
  206. """
  207. with get_session() as session:
  208. grade = DemandGradeRepository(session).get_by_id(demand_grade_id)
  209. if grade is None:
  210. return None
  211. category_names = _category_name_map(session, [grade])
  212. grade_code = str(grade.grade or "").upper()
  213. demand_feedback_count, video_feedback_counts, point_feedback_counts = (
  214. DemandFeedbackRepository(session).count_for_demand(demand_grade_id)
  215. )
  216. if grade_code in _SOURCE_VIDEO_GRADES:
  217. video_ids = _parse_video_ids(grade.video_list)
  218. details = MultiDemandVideoDetailRepository(session).list_by_vids(video_ids)
  219. videos = [
  220. _serialize_video(
  221. video_id,
  222. details.get(video_id),
  223. [],
  224. video_feedback_counts.get(video_id, 0),
  225. )
  226. for video_id in video_ids
  227. ]
  228. else:
  229. expansions = DemandVideoExpansionRepository(session).list_by_demand_grade(
  230. str(grade.biz_dt),
  231. demand_grade_id,
  232. )
  233. video_ids: list[str] = []
  234. points_by_video: dict[str, list[dict[str, Any]]] = {}
  235. for row in expansions:
  236. video_id = str(row.video_id).strip()
  237. if not video_id or row.point_type not in _POINT_TYPES:
  238. continue
  239. if video_id not in points_by_video:
  240. video_ids.append(video_id)
  241. points_by_video[video_id] = []
  242. points_by_video[video_id].append(
  243. {
  244. "id": int(row.id),
  245. "point_type": row.point_type,
  246. "expanded_text": row.expanded_text,
  247. "point_desc": row.point_desc,
  248. "reason": row.reason,
  249. "feedback_summary": {
  250. "count": point_feedback_counts.get(int(row.id), 0)
  251. },
  252. }
  253. )
  254. details = MultiDemandVideoDetailRepository(session).list_by_vids(video_ids)
  255. videos = [
  256. _serialize_video(
  257. video_id,
  258. details.get(video_id),
  259. points_by_video[video_id],
  260. video_feedback_counts.get(video_id, 0),
  261. )
  262. for video_id in video_ids
  263. ]
  264. demand = _serialize_demand(
  265. grade,
  266. category_names,
  267. len(videos),
  268. demand_feedback_count,
  269. )
  270. demand["point_count"] = sum(video["point_count"] for video in videos)
  271. demand["videos"] = videos
  272. demand["video_source"] = (
  273. "pool" if grade_code in _SOURCE_VIDEO_GRADES else "expansion"
  274. )
  275. return demand