
इस लेख में (4)
DeepSeek V4 Pro की कीमतें: पीक और ऑफ-पीक दरों का चार-गुना विश्लेषण
मुख्य बातें
- मॉडल API बजट के लिए मासिक अनुमान नहीं, बल्कि टोकन स्तर की ट्रैकिंग चाहिए।
- पीक और ऑफ-पीक दरें उपयोगकर्ताओं को रोके बिना मांग को दिशा दे सकती हैं।
- कैश हिट, कैश मिस और आउटपुट की लंबाई अब उत्पाद डिजाइन के इनपुट हैं।
V4 Pro कदम दिखाता है कि सस्ती AI पहुँच कैसे दुर्लभ कंप्यूट संसाधनों के उपयोग तक पहुँचने पर संसाधन-सचेत मूल्य निर्धारण में बदल सकती है।
V4 Pro कदम दिखाता है कि सस्ती AI पहुँच कैसे संसाधन-सचेत मूल्य निर्धारण में बदल सकती है, जब उपयोग दुर्लभ कंप्यूट तक पहुँच जाता है।
सस्ती API कीमतें ग्राहक पाने की शानदार रणनीति होती हैं, जब तक कि बिल धुएँ के अलार्म जैसा बजने न लगे। DeepSeek V4 Pro अब उस अजीब से बड़े हो चुके पड़ाव पर पहुँच गया है: API अब सिर्फ एक सक्षम मॉडल तक सस्ती पहुँच के रूप में नहीं बेची जा रही, बल्कि उसे ऐसे साझा इन्फ्रास्ट्रक्चर की तरह मूल्यांकित किया जा रहा है जिसमें रश ऑवर भी है। चार गुना बढ़ोतरी मुख्य खबर है। पीक और ऑफ-पीक का विभाजन असली प्रोडक्ट सीख है।
लॉन्च एक मूल्य संरचना है
Reuters ने रिपोर्ट किया कि DeepSeek ने अपने V4 मॉडलों के लिए API कीमतें बढ़ा दीं, और Channel Insider ने V4 API बढ़ोतरी को चार गुना से अधिक बताया। DeepSeek API Docs के अनुसार, V4 Pro की कीमत अब ऑफ-पीक और पीक दरों में बाँटी गई है, जहाँ ऑफ-पीक घंटों की लागत पीक घंटे की कीमत की आधी है।
DeepSeek ने ऑफ-पीक कीमतों में V4 Pro को प्रति 1M टोकन cache hit input के लिए $0.022, cache miss input के लिए $0.66, और output के लिए $1.98 पर सूचीबद्ध किया है, जो पीक कीमतों में बढ़कर $0.044, $1.32, और $3.96 हो जाता है। V4 Flash भी इसी संरचना का पालन करता है: ऑफ-पीक में $0.007, $0.22, और $0.66, फिर पीक पर $0.014, $0.44, और $1.32।
DeepSeek API Docs दो V4 API मॉडलों के नाम भी बताता है: deepseek-v4-flash जो DeepSeek-V4-Flash-0731 को सर्व करता है, और deepseek-v4-pro जो DeepSeek-V4-Pro-0813 को सर्व करता है। उसी दस्तावेज़ के अनुसार, दोनों 1M context length और 384K के maximum output का उपयोग करते हैं। दिलचस्प विभाजन concurrency में है: DeepSeek V4 Flash के लिए 2500 और V4 Pro के लिए 500 की concurrency limit सूचीबद्ध करता है। यही छोटे रूप में पूरा प्रोडक्ट लाइनअप है: एक लेन throughput के लिए, दूसरी ज़्यादा भारी capability के लिए।
वह concurrency gap ही असली संकेत है। Pricing pages आमतौर पर accounting documents होने का नाटक करते हैं, लेकिन अच्छे pricing pages traffic control systems होते हैं। यह पेज developers को बताता है कि premium capacity अनंत नहीं है और कंपनी चाहती है कि जहाँ संभव हो, usage सस्ते घंटों की ओर जाए।
V4 Pro ज़्यादा कीमत क्यों माँग सकता है
Artificial Analysis, DeepSeek V4 Pro (Reasoning, Max Effort) को April 2026 में जारी किया गया एक open weights model बताता है। मॉडल ने Artificial Analysis Intelligence Index पर 45 स्कोर किया, जबकि comparable models का median 26 था, और साइट कहती है कि यह text input, text output, और 1M token context window को support करता है।
इससे यह समझने में मदद मिलती है कि DeepSeek अपनी challenger posture को पूरी तरह छोड़े बिना higher price ceiling क्यों test कर सकता है। अगर मॉडल सच में काफी मजबूत है, तो pricing conversation सबसे सस्ते token से हटकर useful token पर आ जाती है।
समस्या verbosity है। Artificial Analysis कहता है कि DeepSeek V4 Pro ने अपनी Intelligence Index evaluation में 180M tokens generate किए, जबकि median 99M था, और साइट मॉडल को very verbose कहती है। API economics में यह कोई footnote नहीं है, यह तो meter spinning है। ऐसा मॉडल जो अच्छी reasoning करता है लेकिन बहुत बोलता है, generous output limits को उन customers के लिए cost surprise में बदल सकता है जो prompts, completions, और retries को instrument नहीं करते।
दूसरा प्रभाव व्यवहार से जुड़ा है
DeepSeek API Docs कहता है कि billing input और output tokens की कुल संख्या पर आधारित है, जिसमें input को cache hit और cache miss categories में बाँटा जाता है। नई संरचना में यह अंतर और भी महत्वपूर्ण हो जाता है, क्योंकि महँगा रास्ता सिर्फ V4 Pro का इस्तेमाल करना नहीं है; महँगा रास्ता है peak पर V4 Pro का इस्तेमाल करना, cache miss होना, और लंबे responses generate करना। यह pricing page एक Choose Your Own Adventure जैसा है, जहाँ महँगे endings uncached prompts और verbose outputs से शुरू होते हैं।
Builders के लिए समझदारी इसी में है कि caching और response length को product requirements की तरह treat करें, cleanup tasks की तरह नहीं। Peak और off-peak pricing customer conversation को भी बदल देती है। Flat API price teams को यह पूछने के लिए प्रेरित करती है कि क्या कोई model पर्याप्त सस्ता है। Time based price पूछती है कि क्या workload पर्याप्त urgent है। Batch evaluations, internal analysis, और non interactive jobs अक्सर सस्ती windows में shift हो सकते हैं, जबकि user facing flows latency मायने रखने पर peak rates को justify कर सकते हैं। यह scarce infrastructure के लिए हर token को समान cost profile वाला मानने का नाटक करने से कहीं अधिक ईमानदार model है।
Builders को क्या अपनाना चाहिए, और customers
को क्या देखना चाहिए Reuters और Channel Insider इस बदलाव को price increase के रूप में frame करते हैं, जो सही है, लेकिन अधिक उपयोगी समझ यह है कि DeepSeek adoption pricing से resource aware pricing की ओर बढ़ रहा है। Founders और product leaders के लिए सीख सरल है: अगर low pricing आपका wedge है, तो जल्दी तय करें कि usage वास्तविक होने पर क्या होगा। अगर जवाब अचानक चार गुना bill shock है, तो customers को लगेगा कि उन्हें घेर लिया गया। अगर जवाब cache, timing, और output controls की दिखने वाली ladder है, तो customers plan कर सकते हैं।
Customers के लिए अगले sprint में token level cost observability शामिल होनी चाहिए। Cache hit rates, cache miss rates, output length, peak usage, और कौन-से features को सच में V4 Flash के बजाय V4 Pro चाहिए, इन्हें track करें। DeepSeek की अगली logical move जरूरी नहीं कि एक और price change हो। देखें कि क्या official docs clearer budget controls, caching guidance, और scheduling patterns की ओर evolve होते हैं, जो नई price architecture को operationalize करना आसान बनाते हैं।