[yt-dlp.git] / yt_dlp / extractor / manyvids.py

import re

from .common import InfoExtractor
from ..utils import (
    determine_ext,
    extract_attributes,
    int_or_none,
    str_to_int,
    url_or_none,
    urlencode_postdata,
)


class ManyVidsIE(InfoExtractor):
    _VALID_URL = r'(?i)https?://(?:www\.)?manyvids\.com/video/(?P<id>\d+)'
    _TESTS = [{
        # preview video
        'url': 'https://www.manyvids.com/Video/133957/everthing-about-me/',
        'md5': '03f11bb21c52dd12a05be21a5c7dcc97',
        'info_dict': {
            'id': '133957',
            'ext': 'mp4',
            'title': 'everthing about me (Preview)',
            'uploader': 'ellyxxix',
            'view_count': int,
            'like_count': int,
        },
    }, {
        # full video
        'url': 'https://www.manyvids.com/Video/935718/MY-FACE-REVEAL/',
        'md5': 'bb47bab0e0802c2a60c24ef079dfe60f',
        'info_dict': {
            'id': '935718',
            'ext': 'mp4',
            'title': 'MY FACE REVEAL',
            'description': 'md5:ec5901d41808b3746fed90face161612',
            'uploader': 'Sarah Calanthe',
            'view_count': int,
            'like_count': int,
        },
    }]

    def _real_extract(self, url):
        video_id = self._match_id(url)

        real_url = 'https://www.manyvids.com/video/%s/gtm.js' % (video_id, )
        try:
            webpage = self._download_webpage(real_url, video_id)
        except Exception:
            # probably useless fallback
            webpage = self._download_webpage(url, video_id)

        info = self._search_regex(
            r'''(<div\b[^>]*\bid\s*=\s*(['"])pageMetaDetails\2[^>]*>)''',
            webpage, 'meta details', default='')
        info = extract_attributes(info)

        player = self._search_regex(
            r'''(<div\b[^>]*\bid\s*=\s*(['"])rmpPlayerStream\2[^>]*>)''',
            webpage, 'player details', default='')
        player = extract_attributes(player)

        video_urls_and_ids = (
            (info.get('data-meta-video'), 'video'),
            (player.get('data-video-transcoded'), 'transcoded'),
            (player.get('data-video-filepath'), 'filepath'),
            (self._og_search_video_url(webpage, secure=False, default=None), 'og_video'),
        )

        def txt_or_none(s, default=None):
            return (s.strip() or default) if isinstance(s, str) else default

        uploader = txt_or_none(info.get('data-meta-author'))

        def mung_title(s):
            if uploader:
                s = re.sub(r'^\s*%s\s+[|-]' % (re.escape(uploader), ), '', s)
            return txt_or_none(s)

        title = (
            mung_title(info.get('data-meta-title'))
            or self._html_search_regex(
                (r'<span[^>]+class=["\']item-title[^>]+>([^<]+)',
                 r'<h2[^>]+class=["\']h2 m-0["\'][^>]*>([^<]+)'),
                webpage, 'title', default=None)
            or self._html_search_meta(
                'twitter:title', webpage, 'title', fatal=True))

        title = re.sub(r'\s*[|-]\s+ManyVids\s*$', '', title) or title

        if any(p in webpage for p in ('preview_videos', '_preview.mp4')):
            title += ' (Preview)'

        mv_token = self._search_regex(
            r'data-mvtoken=(["\'])(?P<value>(?:(?!\1).)+)\1', webpage,
            'mv token', default=None, group='value')

        if mv_token:
            # Sets some cookies
            self._download_webpage(
                'https://www.manyvids.com/includes/ajax_repository/you_had_me_at_hello.php',
                video_id, note='Setting format cookies', fatal=False,
                data=urlencode_postdata({
                    'mvtoken': mv_token,
                    'vid': video_id,
                }), headers={
                    'Referer': url,
                    'X-Requested-With': 'XMLHttpRequest'
                })

        formats = []
        for v_url, fmt in video_urls_and_ids:
            v_url = url_or_none(v_url)
            if not v_url:
                continue
            if determine_ext(v_url) == 'm3u8':
                formats.extend(self._extract_m3u8_formats(
                    v_url, video_id, 'mp4', entry_protocol='m3u8_native',
                    m3u8_id='hls'))
            else:
                formats.append({
                    'url': v_url,
                    'format_id': fmt,
                })

        self._remove_duplicate_formats(formats)

        for f in formats:
            if f.get('height') is None:
                f['height'] = int_or_none(
                    self._search_regex(r'_(\d{2,3}[02468])_', f['url'], 'video height', default=None))
            if '/preview/' in f['url']:
                f['format_id'] = '_'.join(filter(None, (f.get('format_id'), 'preview')))
                f['preference'] = -10
            if 'transcoded' in f['format_id']:
                f['preference'] = f.get('preference', -1) - 1

        def get_likes():
            likes = self._search_regex(
                r'''(<a\b[^>]*\bdata-id\s*=\s*(['"])%s\2[^>]*>)''' % (video_id, ),
                webpage, 'likes', default='')
            likes = extract_attributes(likes)
            return int_or_none(likes.get('data-likes'))

        def get_views():
            return str_to_int(self._html_search_regex(
                r'''(?s)<span\b[^>]*\bclass\s*=["']views-wrapper\b[^>]+>.+?<span\b[^>]+>\s*(\d[\d,.]*)\s*</span>''',
                webpage, 'view count', default=None))

        return {
            'id': video_id,
            'title': title,
            'formats': formats,
            'description': txt_or_none(info.get('data-meta-description')),
            'uploader': txt_or_none(info.get('data-meta-author')),
            'thumbnail': (
                url_or_none(info.get('data-meta-image'))
                or url_or_none(player.get('data-video-screenshot'))),
            'view_count': get_views(),
            'like_count': get_likes(),
        }
Commit	Line	Data
db4678e4	1	import re
db4678e4	2
e9b86526	3	from .common import InfoExtractor
38d15ba7 S	4	from ..utils import (
38d15ba7 S	5	determine_ext,
db4678e4	6	extract_attributes,
38d15ba7 S	7	int_or_none,
38d15ba7 S	8	str_to_int,
db4678e4	9	url_or_none,
38d15ba7 S	10	urlencode_postdata,
38d15ba7 S	11	)
e9b86526 J	12
	13
	14	class ManyVidsIE(InfoExtractor):
efc57145	15	_VALID_URL = r'(?i)https?://(?:www\.)?manyvids\.com/video/(?P<id>\d+)'
38d15ba7 S	16	_TESTS = [{
38d15ba7 S	17	# preview video
e9b86526 J	18	'url': 'https://www.manyvids.com/Video/133957/everthing-about-me/',
	19	'md5': '03f11bb21c52dd12a05be21a5c7dcc97',
	20	'info_dict': {
	21	'id': '133957',
	22	'ext': 'mp4',
efc57145	23	'title': 'everthing about me (Preview)',
db4678e4	24	'uploader': 'ellyxxix',
efc57145 S	25	'view_count': int,
	26	'like_count': int,
	27	},
38d15ba7 S	28	}, {
	29	# full video
	30	'url': 'https://www.manyvids.com/Video/935718/MY-FACE-REVEAL/',
db4678e4	31	'md5': 'bb47bab0e0802c2a60c24ef079dfe60f',
38d15ba7 S	32	'info_dict': {
	33	'id': '935718',
	34	'ext': 'mp4',
	35	'title': 'MY FACE REVEAL',
db4678e4	36	'description': 'md5:ec5901d41808b3746fed90face161612',
db4678e4	37	'uploader': 'Sarah Calanthe',
38d15ba7 S	38	'view_count': int,
	39	'like_count': int,
	40	},
	41	}]
e9b86526 J	42
e9b86526 J	43	def _real_extract(self, url):
e9b86526	44	video_id = self._match_id(url)
efc57145	45
db4678e4	46	real_url = 'https://www.manyvids.com/video/%s/gtm.js' % (video_id, )
	47	try:
	48	webpage = self._download_webpage(real_url, video_id)
	49	except Exception:
	50	# probably useless fallback
	51	webpage = self._download_webpage(url, video_id)
	52
	53	info = self._search_regex(
	54	r'''(<div\b[^>]\bid\s=\s(['"])pageMetaDetails\2[^>]>)''',
	55	webpage, 'meta details', default='')
	56	info = extract_attributes(info)
	57
	58	player = self._search_regex(
	59	r'''(<div\b[^>]\bid\s=\s(['"])rmpPlayerStream\2[^>]>)''',
	60	webpage, 'player details', default='')
	61	player = extract_attributes(player)
	62
	63	video_urls_and_ids = (
	64	(info.get('data-meta-video'), 'video'),
	65	(player.get('data-video-transcoded'), 'transcoded'),
	66	(player.get('data-video-filepath'), 'filepath'),
	67	(self._og_search_video_url(webpage, secure=False, default=None), 'og_video'),
	68	)
	69
	70	def txt_or_none(s, default=None):
46d09f87	71	return (s.strip() or default) if isinstance(s, str) else default
db4678e4	72
db4678e4	73	uploader = txt_or_none(info.get('data-meta-author'))
e9b86526	74
db4678e4	75	def mung_title(s):
	76	if uploader:
	77	s = re.sub(r'^\s*%s\s+[\|-]' % (re.escape(uploader), ), '', s)
	78	return txt_or_none(s)
efc57145	79
db4678e4	80	title = (
	81	mung_title(info.get('data-meta-title'))
	82	or self._html_search_regex(
	83	(r'<span[^>]+class=["\']item-title[^>]+>([^<]+)',
	84	r'<h2[^>]+class=["\']h2 m-0["\'][^>]*>([^<]+)'),
	85	webpage, 'title', default=None)
	86	or self._html_search_meta(
	87	'twitter:title', webpage, 'title', fatal=True))
	88
	89	title = re.sub(r'\s[\|-]\s+ManyVids\s$', '', title) or title
38d15ba7 S	90
	91	if any(p in webpage for p in ('preview_videos', '_preview.mp4')):
	92	title += ' (Preview)'
	93
	94	mv_token = self._search_regex(
	95	r'data-mvtoken=(["\'])(?P<value>(?:(?!\1).)+)\1', webpage,
	96	'mv token', default=None, group='value')
	97
	98	if mv_token:
	99	# Sets some cookies
	100	self._download_webpage(
	101	'https://www.manyvids.com/includes/ajax_repository/you_had_me_at_hello.php',
db4678e4	102	video_id, note='Setting format cookies', fatal=False,
db4678e4	103	data=urlencode_postdata({
38d15ba7 S	104	'mvtoken': mv_token,
	105	'vid': video_id,
	106	}), headers={
	107	'Referer': url,
	108	'X-Requested-With': 'XMLHttpRequest'
	109	})
	110
db4678e4	111	formats = []
	112	for v_url, fmt in video_urls_and_ids:
	113	v_url = url_or_none(v_url)
	114	if not v_url:
	115	continue
	116	if determine_ext(v_url) == 'm3u8':
	117	formats.extend(self._extract_m3u8_formats(
	118	v_url, video_id, 'mp4', entry_protocol='m3u8_native',
	119	m3u8_id='hls'))
	120	else:
	121	formats.append({
	122	'url': v_url,
	123	'format_id': fmt,
	124	})
	125
	126	self._remove_duplicate_formats(formats)
	127
	128	for f in formats:
	129	if f.get('height') is None:
	130	f['height'] = int_or_none(
	131	self._search_regex(r'_(\d{2,3}[02468])_', f['url'], 'video height', default=None))
	132	if '/preview/' in f['url']:
	133	f['format_id'] = '_'.join(filter(None, (f.get('format_id'), 'preview')))
	134	f['preference'] = -10
	135	if 'transcoded' in f['format_id']:
	136	f['preference'] = f.get('preference', -1) - 1
	137
db4678e4	138	def get_likes():
	139	likes = self._search_regex(
	140	r'''(<a\b[^>]\bdata-id\s=\s(['"])%s\2[^>]>)''' % (video_id, ),
	141	webpage, 'likes', default='')
	142	likes = extract_attributes(likes)
	143	return int_or_none(likes.get('data-likes'))
efc57145	144
db4678e4	145	def get_views():
	146	return str_to_int(self._html_search_regex(
	147	r'''(?s)<span\b[^>]\bclass\s=["']views-wrapper\b[^>]+>.+?<span\b[^>]+>\s(\d[\d,.])\s*</span>''',
	148	webpage, 'view count', default=None))
efc57145	149
e9b86526 J	150	return {
	151	'id': video_id,
	152	'title': title,
38d15ba7	153	'formats': formats,
db4678e4	154	'description': txt_or_none(info.get('data-meta-description')),
	155	'uploader': txt_or_none(info.get('data-meta-author')),
	156	'thumbnail': (
	157	url_or_none(info.get('data-meta-image'))
	158	or url_or_none(player.get('data-video-screenshot'))),
	159	'view_count': get_views(),
	160	'like_count': get_likes(),
e9b86526	161	}