| 123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475 |
- from __future__ import annotations
- from uuid import uuid4
- from acquisition.domain import CandidateItem, MediaAsset
- from core.models import Card, CardExtract, ExtractedContent, Post
- from decode_content.readers.service import post_from_candidate_item, read_item, read_post
- def test_post_from_candidate_item_prefers_cdn_then_oss_then_source():
- item_id = uuid4()
- item = CandidateItem(
- id=item_id,
- platform="xiaohongshu",
- platform_item_id="abc",
- canonical_url="https://xhs/item/abc",
- title="脚本结构",
- author_name="sam",
- raw_summary="正文",
- source_payload={"topic_list": ["脚本"]},
- )
- media = [
- MediaAsset(item_id=item_id, media_type="image", source_url="source1", cdn_url="cdn1", position=2),
- MediaAsset(item_id=item_id, media_type="image", source_url="source0", oss_url="oss0", position=1),
- ]
- post = post_from_candidate_item(item, media)
- assert post.id == "xiaohongshu_abc"
- assert post.image_urls == ["oss0", "cdn1"]
- assert [card.index for card in post.cards] == [1, 2]
- assert post.body_text == "正文"
- assert post.topic_list == ["脚本"]
- def test_read_post_imgtext_merges_text_cards_and_media():
- post = Post(
- id="xhs_1",
- platform="xiaohongshu",
- url="u",
- content_id="1",
- image_urls=["img1", "img2"],
- cards=[Card(index=1, kind="image", url="img1"), Card(index=2, kind="image", url="img2")],
- )
- def image_reader(p: Post) -> ExtractedContent:
- assert p.id == "xhs_1"
- return ExtractedContent(
- text="主体",
- from_image="图片知识",
- cards=[CardExtract(index=1, content="卡1"), CardExtract(index=2, content="卡2")],
- )
- result = read_post(post, image_reader=image_reader)
- assert "图片知识" in result.text
- assert result.cards[0].content == "卡1"
- assert result.media == {"type": "image", "video_url": None, "images": ["img1", "img2"]}
- def test_read_item_routes_video_to_video_reader():
- item_id = uuid4()
- item = CandidateItem(id=item_id, platform="douyin", platform_item_id="v1", title="视频")
- media = [MediaAsset(item_id=item_id, media_type="video", cdn_url="https://cdn/video.mp4", position=1)]
- def video_reader(post: Post) -> ExtractedContent:
- assert post.video_urls == ["https://cdn/video.mp4"]
- post.cards = [Card(index=1, kind="segment", url=post.video_urls[0], start=0, end=12)]
- return ExtractedContent(text="视频理解", cards=[CardExtract(index=1, content="片段知识")])
- result = read_item(item, media, video_reader=video_reader)
- assert result.media["type"] == "video"
- assert result.cards[0].kind == "segment"
- assert result.cards[0].content == "片段知识"
|